Fiche de révision : Statistiques descriptives et classes

Plan du Cours

  1. Rôles de la statistique descriptive
  2. Données et types de variables
  3. Manipulation des données sous Python
  4. Statistiques des variables qualitatives
  5. Statistiques cumulées des variables ordinales
  6. Indicateurs d’ordre et quantiles ordinaux
  7. Effectifs et fréquences quantitatives
  8. Indicateurs d’ordre quantitatifs
  9. Résumé numérique et moyenne
  10. Quartiles et tendance centrale
  11. Indicateurs de dispersion
  12. Résumé numérique et boxplot
  13. Moments et forme des distributions
  14. Construction des classes
  15. Effectifs et indicateurs par classe

1. Rôles de la statistique descriptive

Notions clés & Définitions

  • Statistiques descriptives : Résument et visualisent des données à l’aide d’indicateurs numériques et de représentations graphiques, généralement sans modélisation probabiliste.

★ À maîtriser

📌 La statistique comprend la collecte et la gestion des données, les statistiques descriptives et la statistique inférentielle.

Compléments

📌 Le résumé ou la visualisation des données entraîne toujours une perte d’information, mais permet de mettre en évidence des tendances.

Astuce mémo

Collecter → décrire → inférer

2. Données et types de variables

Notions clés & Définitions

  • Donnée tabulaire : Dans un tableau de données, les colonnes représentent les variables et les lignes représentent les individus, c’est-à-dire les occurrences, instances ou objets mesurés.
  • Variable qualitative : Une variable qualitative représente une catégorie et peut être binaire, nominale ou ordinale.

★ À maîtriser

📌 Une variable qualitative prend des modalités, tandis qu’une variable quantitative prend des valeurs numériques de comptage ou de mesure.

📌 Une variable quantitative discrète prend des valeurs dans un ensemble fini, tandis qu’une variable quantitative continue peut prendre des valeurs arbitraires dans un ensemble continu.

Compléments

📌 Une variable quantitative est conventionnellement considérée comme continue si son nombre de valeurs dépasse 10 % de la taille de la population et si elle est limitée principalement par la précision de mesure.

  • Dans le jeu de données des pourboires, Smoker est binaire, day et time sont nominales, financial_situation est ordinale, total_bill et tip sont continues, et size est discrète.

Astuce mémo

Qualitative = modalités ; quantitative = valeurs numériques

3. Manipulation des données sous Python

★ À maîtriser

  • L’importation du fichier pokedex.csv dans pandas s’effectue avec la commande pokedex = pd.read_csv('pokedex.csv', sep=","), ce qui crée un objet pandas.DataFrame.

  • La base pokedex contient 1118 individus représentés par 1118 lignes et 63 variables représentées par 63 colonnes.

  • La commande pokedex.info() fournit les noms des colonnes, le nombre d’entrées par variable, les types informatiques et permet d’identifier les données manquantes.

  • Les méthodes loc, iloc, at et iat permettent d’accéder respectivement à des lignes, des colonnes ou des cellules d’un DataFrame selon des étiquettes ou des positions.

  • La commande variable.value_counts() renvoie les modalités ou valeurs d’une variable et leur effectif, classés par défaut dans l’ordre décroissant des effectifs.

Compléments

  • Les commandes pokedex.head() et pokedex.tail() affichent respectivement les 5 premières et les 5 dernières lignes du DataFrame.

  • Les variables comportant des données manquantes sont:

    • type_2
    • ability_2
    • ability_3
    • evolves_from
    • egg_group_2

Astuce mémo

Apercevoir → extraire → compter

4. Statistiques des variables qualitatives

Notions clés & Définitions

  • Statistique : Application ou transformation du n-uplet des observations de cette variable.
  • Mode : La ou les modalités ayant l’effectif le plus élevé dans une série qualitative.
  • Effectif : Le nombre de fois où cette modalité apparaît dans la série.
  • Fréquence : Le nombre de fois où elle apparaît dans la série divisé par le nombre total d’observations n.
  • Effectif cumulé : L’effectif cumulé d’une modalité ordinale est le nombre d’occurrences de cette modalité et de toutes les modalités qui lui sont inférieures ou égales.
  • Fréquence cumulée : La fréquence cumulée d’une modalité ordinale est la somme des fréquences de cette modalité et de toutes les modalités qui lui sont inférieures ou égales.

Points essentiels

  • Un diagramme en bâtons place les modalités sur l’axe des abscisses et représente pour chacune une barre dont la hauteur correspond à son effectif ou à sa fréquence.

📌 Dans un diagramme circulaire, le secteur d’une modalité a un angle égal à sa fréquence multipliée par 360°.

Astuce mémo

Mode = position ; effectifs et fréquences = distribution

5. Statistiques cumulées des variables ordinales

Notions clés & Définitions

  • Effectif cumulé : nombre d’individus dont la modalité m′ vérifie m′ ≼ m
  • Fréquence cumulée : somme des fréquences des modalités m′ telles que m′ ≼ m
  • Fonction de répartition empirique : Pour une variable ordinale numérique, elle associe à tout réel m la proportion d’observations xi vérifiant xi ≼ m et se représente par une fonction en escalier croissante de R vers [0,1], continue à droite

★ À maîtriser

  • Les effectifs cumulés s’obtiennent avec variable.value_counts().sort_index().cumsum(), et les fréquences cumulées avec variable.value_counts(normalize=True).sort_index().cumsum().

Compléments

  • Les effectifs cumulés forment une suite croissante d’entiers et l’effectif cumulé de la plus grande modalité vaut n, tandis que les fréquences cumulées forment une suite croissante comprise entre 0 et 1 et que la dernière vaut 1.

  • Pour représenter les effectifs ou fréquences cumulés, on classe les modalités par ordre croissant puis on trace pour chacune une barre dont la hauteur correspond à la valeur cumulée, avec sns.barplot().

Astuce mémo

Modalités ordonnées → cumulés → quantiles

6. Indicateurs d’ordre et quantiles ordinaux

Notions clés & Définitions

  • Indicateur d’ordre : la k-ième plus petite valeur de la série réordonnée
  • Quantile empirique : la plus petite modalité pour laquelle au moins une proportion α des individus possède une modalité inférieure ou égale, soit ˆqXα = x(⌈αn⌉)

★ À maîtriser

  • Pour une variable ordinale, le minimum est x(1), le maximum est x(n), le premier quartile est x(⌈n/4⌉), la médiane est x(⌈n/2⌉) et le troisième quartile est x(⌈3n/4⌉).

Compléments

  • Pour calculer les indicateurs d’ordre avec Python, les modalités doivent être codées numériquement et ordonnées, puis on utilise variable.min(), np.quantile(variable, α, method='inverted_cdf') et variable.max().

Astuce mémo

Quantile théorique : valeur observée ; quantile interpolé : valeur parfois nouvelle

7. Effectifs et fréquences quantitatives

Notions clés & Définitions

  • Effectif quantitatif : le nombre d’observations xi égales à vk, soit ek=i=1n1{vk}(xi)e_k=\sum_{i=1}^{n}\mathbf{1}_{\{v_k\}}(x_i)

★ À maîtriser

📐 Formule — La fréquence d’une valeur distincte vk est fk=eknf_k=\frac{e_k}{n}.

📌 Les effectifs et fréquences sont réellement utiles et lisibles lorsque le nombre de valeurs distinctes vérifie, par convention, nj ≤ 10 % × n ; cette condition exclut a priori les variables continues et certaines variables discrètes.

📐 Formule — Pour une valeur ordonnée vk, l’effectif cumulé et la fréquence cumulée sont respectivement e~k==1ke\tilde e_k=\sum_{\ell=1}^{k}e_\ell et f~k=e~kn==1kf\tilde f_k=\frac{\tilde e_k}{n}=\sum_{\ell=1}^{k}f_\ell.

Compléments

  • Les diagrammes en bâtons quantitatifs placent les valeurs sur l’axe des abscisses et donnent à chaque barre une hauteur correspondant à l’effectif, l’effectif cumulé, la fréquence ou la fréquence cumulée.

Astuce mémo

Peu de valeurs distinctes → effectifs lisibles → diagrammes adaptés

8. Indicateurs d’ordre quantitatifs

Notions clés & Définitions

  • Fonction quantile empirique linéaire : relie les valeurs ordonnées et peut produire une valeur qui ne figure pas dans la série

★ À maîtriser

📐 Formule — Pour α = k/(n−1), le quantile linéaire vaut q^X,αlin=x(k+1)\hat q^{\,lin}_{X,\alpha}=x_{(k+1)} ; entre deux positions, il vaut q^X,αlin=x(k+1)+λ(x(k+2)x(k+1))\hat q^{\,lin}_{X,\alpha}=x_{(k+1)}+\lambda\bigl(x_{(k+2)}-x_{(k+1)}\bigr).

Compléments

  • Pour α = 0,5 et un effectif pair, le quantile linéaire est la moyenne des deux valeurs centrales, soit q^X,0.5lin=x(n/2)+x(n/2+1)2\hat q^{\,lin}_{X,0.5}=\frac{x_{(n/2)}+x_{(n/2+1)}}{2}.

  • Les quantiles théoriques et linéaires se calculent respectivement avec np.quantile(variable, α, method='inverted_cdf') et np.quantile(variable, α, method='linear').

Astuce mémo

Quantile théorique = valeur de la série ; quantile linéaire = interpolation

9. Résumé numérique et moyenne

Notions clés & Définitions

  • Moyenne usuelle : la somme des observations divisée par leur nombre, soit x=1ni=1nxi\overline{x}=\frac{1}{n}\sum_{i=1}^{n}x_i

Points essentiels

  • La moyenne d’une colonne quantitative se calcule en Python avec variable.mean().

10. Quartiles et tendance centrale

Notions clés & Définitions

  • Médiane usuelle : La médiane usuelle vaut x((n+1)/2)x_{((n+1)/2)} lorsque n est impair et x(n/2)+x(n/2+1)2\frac{x_{(n/2)}+x_{(n/2+1)}}{2} lorsque n est pair.
  • Mode : Le mode est la valeur qui possède l’effectif maximal dans la série et se calcule avec variable.mode().

★ À maîtriser

📐 Formule — Le troisième quartile usuel par interpolation linéaire est calculé avec m3=3n+141m_3=\frac{3n+1}{4}-1 puis q^3/4=x(m3+1)+(m3m3)(x(m3+2)x(m3+1)).\hat q_{3/4}=x_{(\lfloor m_3\rfloor+1)}+(m_3-\lfloor m_3\rfloor)(x_{(\lfloor m_3\rfloor+2)}-x_{(\lfloor m_3\rfloor+1)}).

📐 Formule — La moyenne usuelle d’une série est xˉ=1ni=1nxi\bar x=\frac{1}{n}\sum_{i=1}^{n}x_i et se calcule avec variable.mean().

Compléments

📌 La moyenne est sensible aux valeurs extrêmes, tandis que la médiane est plus robuste et n’est pas affectée par une modification des valeurs extrêmes.

Astuce mémo

Moyenne sensible aux extrêmes, médiane robuste

11. Indicateurs de dispersion

★ À maîtriser

📐 Formule — La variance usuelle est σ^x2=1ni=1n(xixˉ)2\widehat{\sigma}^2_x=\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar x)^2 et l’écart-type usuel est σ^x=σ^x2\widehat{\sigma}_x=\sqrt{\widehat{\sigma}^2_x}.

📐 Formule — L’étendue d’une série est max(x)min(x)\max(x)-\min(x) et l’écart interquartile est q^3/4(x)q^1/4(x)\widehat q_{3/4}(x)-\widehat q_{1/4}(x).

📐 Formule — Les versions corrigées de la variance et de l’écart-type remplacent n par n−1 : σ~x2=1n1i=1n(xixˉ)2\widetilde\sigma_x^2=\frac{1}{n-1}\sum_{i=1}^{n}(x_i-\bar x)^2 et σ~x=σ~x2\widetilde\sigma_x=\sqrt{\widetilde\sigma_x^2}.

Compléments

📐 Formule — L’écart moyen est 1ni=1nxixˉ\frac{1}{n}\sum_{i=1}^{n}|x_i-\bar x|.

📐 Formule — Pour deux séries, la variance vérifie Var(αx+βy)=α2Var(x)+2αβ1ni=1n(xixˉ)(yiyˉ)+β2Var(y).\operatorname{Var}(\alpha x+\beta y)=\alpha^2\operatorname{Var}(x)+2\alpha\beta\frac1n\sum_{i=1}^{n}(x_i-\bar x)(y_i-\bar y)+\beta^2\operatorname{Var}(y).

Astuce mémo

Écart-type dans l’unité, variance dans l’unité au carré

12. Résumé numérique et boxplot

Notions clés & Définitions

  • Boîte à moustaches : La boîte à moustaches représente la médiane par un trait, Q1 et Q3 par les bords de la boîte, et les valeurs situées au-delà par des moustaches et éventuellement des points.

Points essentiels

  • La commande variable.describe() fournit un résumé des principaux indicateurs numériques d’une variable quantitative, dont l’écart-type corrigé et les quartiles par interpolation linéaire.

📌 Avec **whis=1.5**, les moustaches s’étendent jusqu’aux valeurs comprises entre Q11.5IQRQ_1-1.5\,IQR et Q3+1.5IQRQ_3+1.5\,IQR, tandis que les petits cercles représentent les outliers.

📌 Un point atypique présente un comportement différent de la majorité, tandis qu’un point aberrant peut résulter d’une erreur.

Astuce mémo

Une boîte entre Q1 et Q3, prolongée par deux moustaches

13. Moments et forme des distributions

Points essentiels

📐 Formule — Le moment empirique centré d’ordre p est mp(x)=1ni=1n(xixˉ)pm_p(x)=\frac1n\sum_{i=1}^{n}(x_i-\bar x)^p, tandis que le moment non centré d’ordre p est mp(x)=1ni=1nxipm_p(x)=\frac1n\sum_{i=1}^{n}x_i^p.

  • Le moment centré d’ordre 1 est toujours nul et le moment centré d’ordre 2 correspond à la variance usuelle non corrigée.

📐 Formule — L’asymétrie empirique est γ1=n2(n1)(n2)m3(x)σx3\gamma_1=\frac{n^2}{(n-1)(n-2)}\frac{m_3(x)}{\sigma_x^3}.

📐 Formule — Le coefficient d’aplatissement empirique est γ2=m4(x)σx43=1ni=1n(xixˉ)4[1ni=1n(xixˉ)2]23\gamma_2=\frac{m_4(x)}{\sigma_x^4}-3=\frac{\frac1n\sum_{i=1}^{n}(x_i-\bar x)^4}{\left[\frac1n\sum_{i=1}^{n}(x_i-\bar x)^2\right]^2}-3.

Astuce mémo

Moments d’ordre 3 et 4 → asymétrie et aplatissement

14. Construction des classes

Notions clés & Définitions

  • Partition en classes : Une partition en classes découpe l’intervalle [min(x),max(x)][\min(x),\max(x)] en K intervalles deux à deux disjoints dont la réunion est cet intervalle.

Points essentiels

📐 Formule — Pour des classes de même longueur, le pas vaut h=max(x)min(x)Kh=\frac{\max(x)-\min(x)}{K} et les bornes sont calculées avec np.linspace(min(x), max(x), num=K+1).

  • Les choix usuels du nombre de classes utilisent la règle de la racine carrée K=nK=\lfloor\sqrt n\rfloor, la méthode de Sturges K=log2(n)+1K=\lfloor\log_2(n)+1\rfloor et la méthode de Freedman-Diaconis h=2IQR(x)n1/3h=\frac{2IQR(x)}{n^{1/3}}.

📌 Avec pd.cut, right=True produit des intervalles fermés à droite et ouverts à gauche, tandis que right=False produit des intervalles fermés à gauche et ouverts à droite.

Astuce mémo

Intervalle → pas → bornes → classes

15. Effectifs et indicateurs par classe

Notions clés & Définitions

  • Classe médiane : La classe médiane est la première classe dont la fréquence cumulée dépasse 1/2.
  • Classe modale : La ou les classes modales sont les classes dont l’effectif est maximal.

★ À maîtriser

📐 Formule — L’effectif de la classe Ik est ek=i=1n1Ik(xi)e_k=\sum_{i=1}^{n}\mathbf 1_{I_k}(x_i) et sa fréquence est fk=eknf_k=\frac{e_k}{n}.

📐 Formule — L’effectif cumulé est e~k==1ke\widetilde e_k=\sum_{\ell=1}^{k}e_\ell et la fréquence cumulée est f~k=e~kn==1kf\widetilde f_k=\frac{\widetilde e_k}{n}=\sum_{\ell=1}^{k}f_\ell, avec e~K=n\widetilde e_K=n et f~K=1\widetilde f_K=1.

Compléments

📐 Formule — Si la classe médiane est [ℓ,ℓ+w[, d’effectif e, de fréquence f et précédée d’une fréquence cumulée F−, la médiane approximative vaut +(12F)new=+(12F)wf\ell+\left(\frac12-F^-\right)\frac{n}{e}w=\ell+\left(\frac12-F^-\right)\frac{w}{f}.

📐 Formule — L’histogramme en densité attribue à la classe Ik la hauteur fkIk\frac{f_k}{|I_k|} afin que l’aire totale sous l’histogramme soit égale à k=1Kfk=1\sum_{k=1}^{K}f_k=1.

Astuce mémo

Effectifs → fréquences → cumulés → indicateurs

Tableaux de synthèse

Types de variables

TypeCaractéristiqueExemples du cours
Qualitative binaireDeux modalitésSmoker
Qualitative nominaleCatégories sans ordreday, time
Qualitative ordinaleCatégories ordonnéesfinancial_situation
Quantitative discrèteValeurs numériques finiessize
Quantitative continueValeurs numériques continuestotal_bill, tip

Quantiles théoriques et linéaires

NotionDéfinitionValeur observée
Quantile théoriquex(⌈αn⌉)Toujours oui
Quantile linéaireInterpolation entre valeurs ordonnéesPas nécessairement

Teste tes connaissances

Teste tes connaissances sur Statistiques descriptives et classes avec 51 questions à choix multiples et corrections détaillées.

1. Quelle distinction décrit correctement la statistique descriptive et la statistique inférentielle ?

2. Quels outils caractérisent principalement les statistiques descriptives ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Statistiques descriptives et classes avec 83 flashcards interactives.

Quels sont les trois domaines que comprend la statistique ?

La collecte et gestion des données, les statistiques descriptives, et la statistique inférentielle.

Que font les statistiques descriptives avec les données ?

Elles résument et visualisent les données avec des indicateurs numériques et graphiques.

Les statistiques descriptives utilisent-elles toujours une modélisation probabiliste ?

Non, généralement elles n'utilisent pas de modélisation probabiliste.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches