Statistiques descriptives : Résument et visualisent des données à l’aide d’indicateurs numériques et de représentations graphiques, généralement sans modélisation probabiliste.
★ À maîtriser
📌 La statistique comprend la collecte et la gestion des données, les statistiques descriptives et la statistique inférentielle.
Compléments
📌 Le résumé ou la visualisation des données entraîne toujours une perte d’information, mais permet de mettre en évidence des tendances.
💡 Astuce mémo
Collecter → décrire → inférer
📖 2. Données et types de variables
🔑 Notions clés & Définitions
Donnée tabulaire : Dans un tableau de données, les colonnes représentent les variables et les lignes représentent les individus, c’est-à-dire les occurrences, instances ou objets mesurés.
Variable qualitative : Une variable qualitative représente une catégorie et peut être binaire, nominale ou ordinale.
★ À maîtriser
📌 Une variable qualitative prend des modalités, tandis qu’une variable quantitative prend des valeurs numériques de comptage ou de mesure.
📌 Une variable quantitative discrète prend des valeurs dans un ensemble fini, tandis qu’une variable quantitative continue peut prendre des valeurs arbitraires dans un ensemble continu.
Compléments
📌 Une variable quantitative est conventionnellement considérée comme continue si son nombre de valeurs dépasse 10 % de la taille de la population et si elle est limitée principalement par la précision de mesure.
Dans le jeu de données des pourboires, Smoker est binaire, day et time sont nominales, financial_situation est ordinale, total_bill et tip sont continues, et size est discrète.
L’importation du fichier pokedex.csv dans pandas s’effectue avec la commande pokedex = pd.read_csv('pokedex.csv', sep=","), ce qui crée un objet pandas.DataFrame.
La base pokedex contient 1118 individus représentés par 1118 lignes et 63 variables représentées par 63 colonnes.
La commande pokedex.info() fournit les noms des colonnes, le nombre d’entrées par variable, les types informatiques et permet d’identifier les données manquantes.
Les méthodes loc, iloc, at et iat permettent d’accéder respectivement à des lignes, des colonnes ou des cellules d’un DataFrame selon des étiquettes ou des positions.
La commande variable.value_counts() renvoie les modalités ou valeurs d’une variable et leur effectif, classés par défaut dans l’ordre décroissant des effectifs.
Compléments
Les commandes pokedex.head() et pokedex.tail() affichent respectivement les 5 premières et les 5 dernières lignes du DataFrame.
Les variables comportant des données manquantes sont:
type_2
ability_2
ability_3
evolves_from
egg_group_2
💡 Astuce mémo
Apercevoir → extraire → compter
📖 4. Statistiques des variables qualitatives
🔑 Notions clés & Définitions
Statistique : Application ou transformation du n-uplet des observations de cette variable.
Mode : La ou les modalités ayant l’effectif le plus élevé dans une série qualitative.
Effectif : Le nombre de fois où cette modalité apparaît dans la série.
Fréquence : Le nombre de fois où elle apparaît dans la série divisé par le nombre total d’observations n.
Effectif cumulé : L’effectif cumulé d’une modalité ordinale est le nombre d’occurrences de cette modalité et de toutes les modalités qui lui sont inférieures ou égales.
Fréquence cumulée : La fréquence cumulée d’une modalité ordinale est la somme des fréquences de cette modalité et de toutes les modalités qui lui sont inférieures ou égales.
📝 Points essentiels
Un diagramme en bâtons place les modalités sur l’axe des abscisses et représente pour chacune une barre dont la hauteur correspond à son effectif ou à sa fréquence.
📌 Dans un diagramme circulaire, le secteur d’une modalité a un angle égal à sa fréquence multipliée par 360°.
💡 Astuce mémo
Mode = position ; effectifs et fréquences = distribution
📖 5. Statistiques cumulées des variables ordinales
🔑 Notions clés & Définitions
Effectif cumulé : nombre d’individus dont la modalité m′ vérifie m′ ≼ m
Fréquence cumulée : somme des fréquences des modalités m′ telles que m′ ≼ m
Fonction de répartition empirique : Pour une variable ordinale numérique, elle associe à tout réel m la proportion d’observations xi vérifiant xi ≼ m et se représente par une fonction en escalier croissante de R vers [0,1], continue à droite
★ À maîtriser
Les effectifs cumulés s’obtiennent avec variable.value_counts().sort_index().cumsum(), et les fréquences cumulées avec variable.value_counts(normalize=True).sort_index().cumsum().
Compléments
Les effectifs cumulés forment une suite croissante d’entiers et l’effectif cumulé de la plus grande modalité vaut n, tandis que les fréquences cumulées forment une suite croissante comprise entre 0 et 1 et que la dernière vaut 1.
Pour représenter les effectifs ou fréquences cumulés, on classe les modalités par ordre croissant puis on trace pour chacune une barre dont la hauteur correspond à la valeur cumulée, avec sns.barplot().
💡 Astuce mémo
Modalités ordonnées → cumulés → quantiles
📖 6. Indicateurs d’ordre et quantiles ordinaux
🔑 Notions clés & Définitions
Indicateur d’ordre : la k-ième plus petite valeur de la série réordonnée
Quantile empirique : la plus petite modalité pour laquelle au moins une proportion α des individus possède une modalité inférieure ou égale, soit ˆqXα = x(⌈αn⌉)
★ À maîtriser
Pour une variable ordinale, le minimum est x(1), le maximum est x(n), le premier quartile est x(⌈n/4⌉), la médiane est x(⌈n/2⌉) et le troisième quartile est x(⌈3n/4⌉).
Compléments
Pour calculer les indicateurs d’ordre avec Python, les modalités doivent être codées numériquement et ordonnées, puis on utilise variable.min(), np.quantile(variable, α, method='inverted_cdf') et variable.max().
💡 Astuce mémo
Quantile théorique : valeur observée ; quantile interpolé : valeur parfois nouvelle
📖 7. Effectifs et fréquences quantitatives
🔑 Notions clés & Définitions
Effectif quantitatif : le nombre d’observations xi égales à vk, soit ek=∑i=1n1{vk}(xi)
★ À maîtriser
📐 Formule — La fréquence d’une valeur distincte vk est fk=nek.
📌 Les effectifs et fréquences sont réellement utiles et lisibles lorsque le nombre de valeurs distinctes vérifie, par convention, nj ≤ 10 % × n ; cette condition exclut a priori les variables continues et certaines variables discrètes.
📐 Formule — Pour une valeur ordonnée vk, l’effectif cumulé et la fréquence cumulée sont respectivement e~k=∑ℓ=1keℓ et f~k=ne~k=∑ℓ=1kfℓ.
Compléments
Les diagrammes en bâtons quantitatifs placent les valeurs sur l’axe des abscisses et donnent à chaque barre une hauteur correspondant à l’effectif, l’effectif cumulé, la fréquence ou la fréquence cumulée.
💡 Astuce mémo
Peu de valeurs distinctes → effectifs lisibles → diagrammes adaptés
📖 8. Indicateurs d’ordre quantitatifs
🔑 Notions clés & Définitions
Fonction quantile empirique linéaire : relie les valeurs ordonnées et peut produire une valeur qui ne figure pas dans la série
★ À maîtriser
📐 Formule — Pour α = k/(n−1), le quantile linéaire vaut q^X,αlin=x(k+1) ; entre deux positions, il vaut q^X,αlin=x(k+1)+λ(x(k+2)−x(k+1)).
Compléments
Pour α = 0,5 et un effectif pair, le quantile linéaire est la moyenne des deux valeurs centrales, soit q^X,0.5lin=2x(n/2)+x(n/2+1).
Les quantiles théoriques et linéaires se calculent respectivement avec np.quantile(variable, α, method='inverted_cdf') et np.quantile(variable, α, method='linear').
💡 Astuce mémo
Quantile théorique = valeur de la série ; quantile linéaire = interpolation
📖 9. Résumé numérique et moyenne
🔑 Notions clés & Définitions
Moyenne usuelle : la somme des observations divisée par leur nombre, soit x=n1∑i=1nxi
📝 Points essentiels
La moyenne d’une colonne quantitative se calcule en Python avec variable.mean().
📖 10. Quartiles et tendance centrale
🔑 Notions clés & Définitions
Médiane usuelle : La médiane usuelle vaut x((n+1)/2) lorsque n est impair et 2x(n/2)+x(n/2+1) lorsque n est pair.
Mode : Le mode est la valeur qui possède l’effectif maximal dans la série et se calcule avec variable.mode().
★ À maîtriser
📐 Formule — Le troisième quartile usuel par interpolation linéaire est calculé avec m3=43n+1−1 puis q^3/4=x(⌊m3⌋+1)+(m3−⌊m3⌋)(x(⌊m3⌋+2)−x(⌊m3⌋+1)).
📐 Formule — La moyenne usuelle d’une série est xˉ=n1∑i=1nxi et se calcule avec variable.mean().
Compléments
📌 La moyenne est sensible aux valeurs extrêmes, tandis que la médiane est plus robuste et n’est pas affectée par une modification des valeurs extrêmes.
💡 Astuce mémo
Moyenne sensible aux extrêmes, médiane robuste
📖 11. Indicateurs de dispersion
★ À maîtriser
📐 Formule — La variance usuelle est σx2=n1∑i=1n(xi−xˉ)2 et l’écart-type usuel est σx=σx2.
📐 Formule — L’étendue d’une série est max(x)−min(x) et l’écart interquartile est q3/4(x)−q1/4(x).
📐 Formule — Les versions corrigées de la variance et de l’écart-type remplacent n par n−1 : σx2=n−11∑i=1n(xi−xˉ)2 et σx=σx2.
Compléments
📐 Formule — L’écart moyen est n1∑i=1n∣xi−xˉ∣.
📐 Formule — Pour deux séries, la variance vérifie Var(αx+βy)=α2Var(x)+2αβn1∑i=1n(xi−xˉ)(yi−yˉ)+β2Var(y).
💡 Astuce mémo
Écart-type dans l’unité, variance dans l’unité au carré
📖 12. Résumé numérique et boxplot
🔑 Notions clés & Définitions
Boîte à moustaches : La boîte à moustaches représente la médiane par un trait, Q1 et Q3 par les bords de la boîte, et les valeurs situées au-delà par des moustaches et éventuellement des points.
📝 Points essentiels
La commande variable.describe() fournit un résumé des principaux indicateurs numériques d’une variable quantitative, dont l’écart-type corrigé et les quartiles par interpolation linéaire.
📌 Avec **whis=1.5**, les moustaches s’étendent jusqu’aux valeurs comprises entre Q1−1.5IQR et Q3+1.5IQR, tandis que les petits cercles représentent les outliers.
📌 Un point atypique présente un comportement différent de la majorité, tandis qu’un point aberrant peut résulter d’une erreur.
💡 Astuce mémo
Une boîte entre Q1 et Q3, prolongée par deux moustaches
📖 13. Moments et forme des distributions
📝 Points essentiels
📐 Formule — Le moment empirique centré d’ordre p est mp(x)=n1∑i=1n(xi−xˉ)p, tandis que le moment non centré d’ordre p est mp(x)=n1∑i=1nxip.
Le moment centré d’ordre 1 est toujours nul et le moment centré d’ordre 2 correspond à la variance usuelle non corrigée.
📐 Formule — L’asymétrie empirique est γ1=(n−1)(n−2)n2σx3m3(x).
📐 Formule — Le coefficient d’aplatissement empirique est γ2=σx4m4(x)−3=[n1∑i=1n(xi−xˉ)2]2n1∑i=1n(xi−xˉ)4−3.
💡 Astuce mémo
Moments d’ordre 3 et 4 → asymétrie et aplatissement
📖 14. Construction des classes
🔑 Notions clés & Définitions
Partition en classes : Une partition en classes découpe l’intervalle [min(x),max(x)] en K intervalles deux à deux disjoints dont la réunion est cet intervalle.
📝 Points essentiels
📐 Formule — Pour des classes de même longueur, le pas vaut h=Kmax(x)−min(x) et les bornes sont calculées avec np.linspace(min(x), max(x), num=K+1).
Les choix usuels du nombre de classes utilisent la règle de la racine carrée K=⌊n⌋, la méthode de Sturges K=⌊log2(n)+1⌋ et la méthode de Freedman-Diaconis h=n1/32IQR(x).
📌 Avec pd.cut, right=True produit des intervalles fermés à droite et ouverts à gauche, tandis que right=False produit des intervalles fermés à gauche et ouverts à droite.
💡 Astuce mémo
Intervalle → pas → bornes → classes
📖 15. Effectifs et indicateurs par classe
🔑 Notions clés & Définitions
Classe médiane : La classe médiane est la première classe dont la fréquence cumulée dépasse 1/2.
Classe modale : La ou les classes modales sont les classes dont l’effectif est maximal.
★ À maîtriser
📐 Formule — L’effectif de la classe Ik est ek=∑i=1n1Ik(xi) et sa fréquence est fk=nek.
📐 Formule — L’effectif cumulé est ek=∑ℓ=1keℓ et la fréquence cumulée est fk=nek=∑ℓ=1kfℓ, avec eK=n et fK=1.
Compléments
📐 Formule — Si la classe médiane est [ℓ,ℓ+w[, d’effectif e, de fréquence f et précédée d’une fréquence cumulée F−, la médiane approximative vaut ℓ+(21−F−)enw=ℓ+(21−F−)fw.
📐 Formule — L’histogramme en densité attribue à la classe Ik la hauteur ∣Ik∣fk afin que l’aire totale sous l’histogramme soit égale à ∑k=1Kfk=1.
💡 Astuce mémo
Effectifs → fréquences → cumulés → indicateurs
📊 Tableaux de synthèse
Types de variables
Type
Caractéristique
Exemples du cours
Qualitative binaire
Deux modalités
Smoker
Qualitative nominale
Catégories sans ordre
day, time
Qualitative ordinale
Catégories ordonnées
financial_situation
Quantitative discrète
Valeurs numériques finies
size
Quantitative continue
Valeurs numériques continues
total_bill, tip
Quantiles théoriques et linéaires
Notion
Définition
Valeur observée
Quantile théorique
x(⌈αn⌉)
Toujours oui
Quantile linéaire
Interpolation entre valeurs ordonnées
Pas nécessairement
Teste tes connaissances
Teste tes connaissances sur Statistiques descriptives et classes avec 51 questions à choix multiples et corrections détaillées.
1. Quelle distinction décrit correctement la statistique descriptive et la statistique inférentielle ?
2. Quels outils caractérisent principalement les statistiques descriptives ?