★ À maîtriser
📌 La statistique descriptive résume et explore les données observées, tandis que la statistique inférentielle permet de prendre des décisions ou de généraliser les résultats d’un échantillon à une population.
Compléments
Question → données → description → inférence
★ À maîtriser
📌 Une problématique descriptive cherche à résumer les données, dégager des profils, regrouper des individus comparables ou étudier des liens entre variables sans extrapoler nécessairement à une population.
📌 Une problématique analytique cherche à estimer, tester ou prédire une caractéristique de la population à partir d’un échantillon.
Compléments
Les sondages électoraux estiment, à partir d’une sous-partie des votants, la proportion de personnes favorables à chaque candidat afin de projeter le gagnant le jour de l’élection.
En santé publique, des mesures de particules fines réalisées par des capteurs peuvent servir à décider du déclenchement d’une alerte pollution ou de limitations de vitesse à l’échelle d’une ville ou d’une région.
Décrire l’échantillon ou extrapoler à la population
★ À maîtriser
📌 Dans une relation étudiée par régression, la variable explicative est placée sur l’axe des X et la variable réponse, aussi appelée variable dépendante, sur l’axe des Y.
Compléments
📌 Les axes peuvent être intervertis lorsque les deux variables entretiennent seulement une association, comme la taille et le poids, mais ils doivent respecter le sens explicatif lorsque la causalité étudiée impose une direction.
X explique, Y répond
★ À maîtriser
📌 Une corrélation positive signifie que les variables X et Y augmentent dans le même sens, tandis qu’une corrélation négative signifie qu’elles évoluent en sens opposé.
📌 Une relation courbe peut exister alors que la corrélation linéaire est proche de zéro, comme dans une relation en parabole.
Compléments
Une patate signifie absence de structure linéaire
★ À maîtriser
📌 Un coefficient de corrélation positif indique que X et Y varient dans le même sens, un coefficient négatif qu’ils varient en sens opposé, et un coefficient proche de zéro l’absence de corrélation linéaire.
Compléments
📌 Le coefficient de corrélation r décrit l’échantillon, tandis que le coefficient ρ décrit la corrélation correspondante dans la population.
📌 La variance mesure la même dispersion que l’écart-type, mais elle est égale au carré de l’écart-type.
Signe = sens ; valeur absolue = intensité
★ À maîtriser
📌 Une corrélation décrit une association entre deux variables, tandis qu’une causalité affirme qu’une variable produit un effet sur l’autre.
Compléments
Variable intermédiaire → corrélation artificielle
★ À maîtriser
Un test du coefficient de corrélation consiste à formuler les hypothèses, observer les données et calculer r, calculer le paramètre de test, puis décider du rejet ou du non-rejet de H0.
Pour un test bilatéral du coefficient de corrélation, H0 affirme que les variables sont linéairement indépendantes, ce qui équivaut à r = 0, tandis que H1 affirme qu’elles sont linéairement dépendantes, ce qui équivaut à r ≠ 0.
Un test statistique ne permet pas d’affirmer avec certitude que H0 est vraie ou fausse, mais conduit à rejeter H0 ou à ne pas la rejeter avec un risque d’erreur.
Si n > 30, le paramètre de test suit sous H0 une loi normale centrée réduite, tandis que si n < 30, il suit une loi de Student à n - 2 degrés de liberté, sous réserve de la normalité des variables X et Y.
Dans cet exemple, la p-value vaut 4·10^-96, valeur extrêmement faible qui conduit à rejeter H0 et à conclure à une corrélation linéaire hautement significative.
Compléments
H0/H1 → r → paramètre → décision
📐 Formule - L’équation générale d’une droite de régression s’écrit .
La droite se rapproche des points en minimisant les carrés
Dans l’équation y = 0,96x + 110, la pente vaut 0,96 et l’ordonnée à l’origine vaut 110.
Dans l’équation y = 0,96x + 110, une année supplémentaire d’âge est associée à une augmentation moyenne de 0,96 point de la tension artérielle.
Pente = variation ; intercept = valeur à X nul
★ À maîtriser
📌 La droite de régression peut prédire une valeur non mesurée, mais cette prédiction n’est fiable que si la relation linéaire est forte et significative.
📌 Plus R² est proche de 1, plus la droite explique la variabilité des données.
Compléments
📌 Des résidus petits et distribués aléatoirement indiquent que la droite est bien adaptée aux données.
Nuage → r → test → droite → R² → résidus
★ À maîtriser
Compléments
| Indicateur | Rôle | Valeurs ou interprétation |
|---|---|---|
| r | Direction et intensité du lien linéaire | De -1 à 1 |
| Pente | Variation moyenne de y pour une unité de x | Positive, négative ou proche de zéro |
| R² | Qualité de l’ajustement de la droite | De 0 à 1 |
| Résidus | Écart entre valeurs observées et prédites | Petits et aléatoires = bon ajustement |
| Situation | Interprétation | Variable intermédiaire |
|---|---|---|
| Cigognes et naissances | Corrélation artificielle | Temps |
| Taille et longueur des cheveux | Association potentiellement trompeuse | Sexe |
Teste tes connaissances sur Corrélation et régression linéaire avec 32 questions à choix multiples et corrections détaillées.
1. Dans quel but principal les statistiques sont-elles mobilisées dans la recherche scientifique ?
2. Quelle distinction caractérise la statistique descriptive et la statistique inférentielle ?
Mémorisez les concepts clés de Corrélation et régression linéaire avec 67 flashcards interactives.
À quoi servent les statistiques dans l'analyse des données ?
À analyser des données issues d'enquêtes ou d'expérimentations.
Que permet la statistique descriptive par rapport aux données observées ?
Elle résume et explore les données observées.
Quel est le rôle de la statistique inférentielle ?
Elle permet de généraliser les résultats d’un échantillon à une population.
Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.
Générateur de fiches