Fiche de révision : Corrélation et régression linéaire

Plan du Cours

  1. Démarche statistique et données
  2. Formulation des problématiques statistiques
  3. Variables quantitatives et rôles
  4. Nuage de points et corrélation
  5. Coefficient de corrélation de Pearson
  6. Corrélation et causalité
  7. Test du coefficient de corrélation
  8. Régression et moindres carrés
  9. Interprétation de la droite
  10. Qualité du modèle et prédiction
  11. Application de la régression sous Excel

1. Démarche statistique et données

★ À maîtriser

  • Les statistiques servent à analyser des données produites par des enquêtes ou des expérimentations et à lire de manière critique les analyses, tableaux et p-values des articles scientifiques.

📌 La statistique descriptive résume et explore les données observées, tandis que la statistique inférentielle permet de prendre des décisions ou de généraliser les résultats d’un échantillon à une population.

  • Une démarche statistique commence par une question précise, se poursuit par des observations ou mesures produisant des données, puis se termine par l’analyse de ces données en lien avec la question initiale.

Compléments

  • Les statistiques raisonnent généralement sur des échantillons, c’est-à-dire des sous-parties de populations, et non sur les populations entières.

Astuce mémo

Question → données → description → inférence

2. Formulation des problématiques statistiques

Notions clés & Définitions

  • Intervalle de confiance : Est une estimation, obtenue à partir d’un échantillon, d’une plage de valeurs dans laquelle une caractéristique de la population a de grandes chances de se trouver.

★ À maîtriser

📌 Une problématique descriptive cherche à résumer les données, dégager des profils, regrouper des individus comparables ou étudier des liens entre variables sans extrapoler nécessairement à une population.

📌 Une problématique analytique cherche à estimer, tester ou prédire une caractéristique de la population à partir d’un échantillon.

Compléments

  • Les sondages électoraux estiment, à partir d’une sous-partie des votants, la proportion de personnes favorables à chaque candidat afin de projeter le gagnant le jour de l’élection.

  • En santé publique, des mesures de particules fines réalisées par des capteurs peuvent servir à décider du déclenchement d’une alerte pollution ou de limitations de vitesse à l’échelle d’une ville ou d’une région.

Astuce mémo

Décrire l’échantillon ou extrapoler à la population

3. Variables quantitatives et rôles

Notions clés & Définitions

  • Corrélation : Est l’étude du lien statistique entre deux variables quantitatives.

★ À maîtriser

📌 Dans une relation étudiée par régression, la variable explicative est placée sur l’axe des X et la variable réponse, aussi appelée variable dépendante, sur l’axe des Y.

Compléments

  • L’âge et la tension artérielle sont deux variables quantitatives mesurées sur les individus d’un échantillon de 40 hommes.

📌 Les axes peuvent être intervertis lorsque les deux variables entretiennent seulement une association, comme la taille et le poids, mais ils doivent respecter le sens explicatif lorsque la causalité étudiée impose une direction.

Astuce mémo

X explique, Y répond

4. Nuage de points et corrélation

★ À maîtriser

  • L’étude de deux variables quantitatives commence par la réalisation et l’observation d’un nuage de points avant toute quantification de la relation.

📌 Une corrélation positive signifie que les variables X et Y augmentent dans le même sens, tandis qu’une corrélation négative signifie qu’elles évoluent en sens opposé.

  • Un nuage de points sans structure organisée, ressemblant à une « patate », suggère une absence de relation linéaire entre les variables.

📌 Une relation courbe peut exister alors que la corrélation linéaire est proche de zéro, comme dans une relation en parabole.

Compléments

  • Dans l’exemple de l’âge et de la tension artérielle chez 40 hommes, le nuage de points présente une tendance positive.

Astuce mémo

Une patate signifie absence de structure linéaire

5. Coefficient de corrélation de Pearson

Notions clés & Définitions

  • Coefficient de corrélation de Pearson : Mesure la direction et l’intensité d’un lien linéaire entre deux variables quantitatives, sans unité, avec une valeur comprise entre -1 et 1.
  • Écart-type : Mesure la dispersion des valeurs autour de leur moyenne, augmente lorsque les valeurs s’en éloignent davantage et reste toujours positif.

★ À maîtriser

📌 Un coefficient de corrélation positif indique que X et Y varient dans le même sens, un coefficient négatif qu’ils varient en sens opposé, et un coefficient proche de zéro l’absence de corrélation linéaire.

  • Pour l’âge et la tension artérielle dans l’échantillon étudié, le coefficient de corrélation vaut r = 0,86.

Compléments

  • Dans un autre exemple, une corrélation presque parfaite est représentée par r = 0,99, tandis qu’une absence de corrélation linéaire est illustrée par r = -0,05.

📌 Le coefficient de corrélation r décrit l’échantillon, tandis que le coefficient ρ décrit la corrélation correspondante dans la population.

📌 La variance mesure la même dispersion que l’écart-type, mais elle est égale au carré de l’écart-type.

Astuce mémo

Signe = sens ; valeur absolue = intensité

6. Corrélation et causalité

★ À maîtriser

📌 Une corrélation décrit une association entre deux variables, tandis qu’une causalité affirme qu’une variable produit un effet sur l’autre.

  • La corrélation entre le nombre de cigognes et le nombre de naissances en Alsace est artificielle et s’explique par leur évolution commune au cours du temps, qui joue le rôle de variable intermédiaire.

Compléments

  • La corrélation négative entre la taille et la longueur des cheveux peut s’expliquer par le sexe, variable intermédiaire associée à la taille et à la longueur des cheveux.

Astuce mémo

Variable intermédiaire → corrélation artificielle

7. Test du coefficient de corrélation

★ À maîtriser

  • Un test du coefficient de corrélation consiste à formuler les hypothèses, observer les données et calculer r, calculer le paramètre de test, puis décider du rejet ou du non-rejet de H0.

  • Pour un test bilatéral du coefficient de corrélation, H0 affirme que les variables sont linéairement indépendantes, ce qui équivaut à r = 0, tandis que H1 affirme qu’elles sont linéairement dépendantes, ce qui équivaut à r ≠ 0.

  • Un test statistique ne permet pas d’affirmer avec certitude que H0 est vraie ou fausse, mais conduit à rejeter H0 ou à ne pas la rejeter avec un risque d’erreur.

  • Si n > 30, le paramètre de test suit sous H0 une loi normale centrée réduite, tandis que si n < 30, il suit une loi de Student à n - 2 degrés de liberté, sous réserve de la normalité des variables X et Y.

  • Dans cet exemple, la p-value vaut 4·10^-96, valeur extrêmement faible qui conduit à rejeter H0 et à conclure à une corrélation linéaire hautement significative.

Compléments

  • Avec r = 0,86 et n = 40, le paramètre de test vaut t = 20,8 et conduit au rejet de H0 au risque α = 5 %.

Astuce mémo

H0/H1 → r → paramètre → décision

8. Régression et moindres carrés

Notions clés & Définitions

  • Régression linéaire : Est une méthode statistique qui obtient l’équation de la droite s’ajustant le mieux aux données.
  • Critère des moindres carrés : Le critère des moindres carrés choisit la droite en minimisant la somme des carrés des résidus entre les valeurs observées et les valeurs prédites.
  • Résidu : Est l’écart entre la valeur observée d’une observation et la valeur prédite ou ajustée par la droite de régression.

Points essentiels

📐 Formule - L’équation générale d’une droite de régression s’écrit y=ax+by = ax + b.

Astuce mémo

La droite se rapproche des points en minimisant les carrés

9. Interprétation de la droite

Notions clés & Définitions

  • Pente : Aussi appelée coefficient directeur, indique la variation moyenne de y lorsque x augmente d’une unité.
  • Ordonnée à l’origine : Aussi appelée intercept, est la valeur estimée de y lorsque x est égal à zéro.

Points essentiels

  • Dans l’équation y = 0,96x + 110, la pente vaut 0,96 et l’ordonnée à l’origine vaut 110.

  • Dans l’équation y = 0,96x + 110, une année supplémentaire d’âge est associée à une augmentation moyenne de 0,96 point de la tension artérielle.

Astuce mémo

Pente = variation ; intercept = valeur à X nul

10. Qualité du modèle et prédiction

Notions clés & Définitions

  • Coefficient de détermination : Compris entre 0 et 1, évalue la qualité de l’ajustement de la droite aux données.

★ À maîtriser

📌 La droite de régression peut prédire une valeur non mesurée, mais cette prédiction n’est fiable que si la relation linéaire est forte et significative.

  • Lorsque le nuage de points ressemble à une patate, r est proche de zéro et la pente de la droite est proche de zéro, ce qui donne une droite presque horizontale sans capacité prédictive.

📌 Plus R² est proche de 1, plus la droite explique la variabilité des données.

Compléments

📌 Des résidus petits et distribués aléatoirement indiquent que la droite est bien adaptée aux données.

Astuce mémo

Nuage → r → test → droite → R² → résidus

11. Application de la régression sous Excel

★ À maîtriser

  • 🔄 L’analyse d’une régression linéaire suit cet ordre:
    1. Tracer le nuage de points
    2. Calculer le coefficient r
    3. Tester la significativité de la relation
    4. Établir l’équation de la droite
    5. Calculer R²
    6. Analyser les résidus

Compléments

  • Dans Excel, l’insertion d’une droite de tendance permet d’afficher l’équation de la droite et la valeur de R².

Tableaux de synthèse

Indicateurs de corrélation et régression

IndicateurRôleValeurs ou interprétation
rDirection et intensité du lien linéaireDe -1 à 1
PenteVariation moyenne de y pour une unité de xPositive, négative ou proche de zéro
R²Qualité de l’ajustement de la droiteDe 0 à 1
RésidusÉcart entre valeurs observées et préditesPetits et aléatoires = bon ajustement

Corrélation et causalité

SituationInterprétationVariable intermédiaire
Cigognes et naissancesCorrélation artificielleTemps
Taille et longueur des cheveuxAssociation potentiellement trompeuseSexe

Teste tes connaissances

Teste tes connaissances sur Corrélation et régression linéaire avec 32 questions à choix multiples et corrections détaillées.

1. Dans quel but principal les statistiques sont-elles mobilisées dans la recherche scientifique ?

2. Quelle distinction caractérise la statistique descriptive et la statistique inférentielle ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Corrélation et régression linéaire avec 67 flashcards interactives.

À quoi servent les statistiques dans l'analyse des données ?

À analyser des données issues d'enquêtes ou d'expérimentations.

Que permet la statistique descriptive par rapport aux données observées ?

Elle résume et explore les données observées.

Quel est le rôle de la statistique inférentielle ?

Elle permet de généraliser les résultats d’un échantillon à une population.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches