Fiche de révision : Associations et estimation statistique

Plan du Cours

  1. Rôle et objectifs de la biostatistique
  2. Variabilité, populations et échantillons
  3. Types de variables et transformations
  4. Description statistique des données
  5. Premiers concepts de probabilité
  6. Probabilités conditionnelles et diagnostic
  7. Variables discrètes et lois usuelles
  8. Variables continues et loi normale
  9. Sommes et associations statistiques
  10. Risque relatif et odds ratio
  11. Régression et corrélation linéaires
  12. Variables quantitatives et qualitatives
  13. Échantillonnage et intervalles
  14. Intervalles de confiance
  15. Principes des tests statistiques
  16. Principaux tests statistiques
  17. Données de survie censurées
  18. Fonction et courbe de survie

1. Rôle et objectifs de la biostatistique

Notions clés & Définitions

  • Biostatistique : Statistique appliquée aux sciences du vivant, à la biologie et à la médecine.
  • Épidémiologie : Science qui étudie, dans des populations humaines, animales ou végétales, la fréquence et la répartition des problèmes de santé dans le temps et dans l’espace ainsi que les facteurs qui les déterminent ou modifient le devenir des maladies.

Points essentiels

  • La biostatistique permet de passer de l’observation réalisée sur un échantillon à une généralisation concernant une population plus large.

  • La biostatistique permet notamment d’évaluer une valeur biologique normale, l’intérêt d’un examen complémentaire, le risque d’une complication et l’efficacité comparative de traitements.

Astuce mémo

Observation d’un échantillon → généralisation à la population → progrès des connaissances médicales

2. Variabilité, populations et échantillons

Notions clés & Définitions

  • Population : Ensemble des individus auquel on souhaite généraliser les conclusions d’une expérience, généralement beaucoup plus grand que l’échantillon.

★ À maîtriser

  • Un échantillon est représentatif de sa population lorsqu’il a été obtenu par tirage au sort, condition nécessaire et suffisante selon le cours ; un échantillon non représentatif est biaisé.

  • La variabilité totale est la résultante de la variabilité biologique et de la variabilité métrologique, cette dernière correspondant à l’erreur due aux appareils de mesure.

  • La variabilité biologique résulte de la variabilité intra-individuelle, observée lors de mesures répétées chez un même individu, et de la variabilité inter-individuelle, observée entre différents individus.

Compléments

  • La variabilité intra-individuelle est généralement plus faible que la variabilité inter-individuelle.

Astuce mémo

Biologique = variation du vivant ; métrologique = erreur de mesure

3. Types de variables et transformations

Notions clés & Définitions

  • Variable aléatoire : Caractéristique d’un individu pouvant prendre plusieurs valeurs incertaines, lesquelles deviennent des réalisations lorsqu’elles sont observées.
  • Variable censurée : Mesure la durée avant un événement alors que certains sujets n’ont pas encore présenté cet événement au moment de l’analyse.

★ À maîtriser

  • Transformer une variable quantitative continue en classes qualitatives entraîne une perte d’information, tandis que coder numériquement une variable qualitative ne la rend pas automatiquement quantitative.

  • Une variable quantitative prend des valeurs numériques et peut être discrète, comme le nombre d’enfants, ou continue, comme le poids mesuré avec une précision suffisante.

  • Une variable qualitative nominale possède des modalités sans ordre naturel, comme la couleur des yeux, tandis qu’une variable qualitative ordinale possède des modalités ordonnées, comme un niveau faible, moyen ou fort.

Compléments

📌 Les modalités d’une variable qualitative doivent être disjointes et couvrir l’ensemble des valeurs possibles.

Astuce mémo

Quantitative = nombre ; qualitative = catégorie ; censurée = durée jusqu’à l’événement

4. Description statistique des données

Notions clés & Définitions

  • Fréquence : Proportion d’individus qu’elle contient et peut être exprimée en pourcentage.
  • Fonction de répartition : La fonction de répartition F(a) est la somme des fréquences correspondant aux valeurs inférieures ou égales à a ; elle est croissante, positive, vaut 0 avant la plus petite valeur et 1 à partir de la plus grande.
  • Écart-type : Racine carrée de la variance et mesure la dispersion autour de la moyenne dans la même unité que la variable.

Points essentiels

📐 Formule — Pour une classe k, la fréquence vérifie fk=nknf_k = \frac{n_k}{n}, avec n=n1+⋯+nKn = n_1 + \cdots + n_K.

📐 Formule — La moyenne empirique de n observations vérifie m=1n∑i=1nxim = \frac{1}{n}\sum_{i=1}^{n} x_i.

📐 Formule — La variance empirique vérifie var⁡(x)=moy⁡(x2)−m2\operatorname{var}(x)=\operatorname{moy}(x^2)-m^2 et mesure la dispersion des valeurs autour de la moyenne.

  • Pour une variable qualitative, un diagramme en bâtons représente chaque modalité par une barre dont la hauteur correspond à l’effectif ou à la fréquence, tandis que la largeur n’a pas d’interprétation.

Astuce mémo

Diagramme en bâtons : hauteur ; histogramme : aire

5. Premiers concepts de probabilité

Notions clés & Définitions

  • Événement élémentaire : Événement qui ne peut pas être décomposé, tandis qu’un événement composé résulte d’une combinaison d’événements élémentaires.
  • Probabilité : Fonction qui attribue à chaque événement une valeur numérique comprise entre 0 et 1.

Points essentiels

📐 Formule — Pour deux événements A et B, Pr⁡(A OU B)=Pr⁡(A)+Pr⁡(B)−Pr⁡(A ET B)\Pr(A\ \mathrm{OU}\ B)=\Pr(A)+\Pr(B)-\Pr(A\ \mathrm{ET}\ B).

📐 Formule — La probabilité conditionnelle vérifie Pr⁡(A∣B)=Pr⁡(A ET B)Pr⁡(B)\Pr(A\mid B)=\frac{\Pr(A\ \mathrm{ET}\ B)}{\Pr(B)}.

📐 Formule — Deux événements A et B sont indépendants si Pr⁡(A ET B)=Pr⁡(A)×Pr⁡(B)\Pr(A\ \mathrm{ET}\ B)=\Pr(A)\times\Pr(B), ce qui signifie que la réalisation de l’un n’a pas d’effet sur l’autre.

📌 Un phénomène déterministe donne le même résultat lorsqu’on répète l’expérience, tandis qu’un phénomène aléatoire produit des résultats variables dont la répartition est prévisible.

Astuce mémo

Déterministe = résultat prévisible ; aléatoire = résultats variables mais répartition prévisible

6. Probabilités conditionnelles et diagnostic

Notions clés & Définitions

  • Sensibilité : La probabilité qu’un test soit positif chez les malades, Pr⁡(T+∣M+)\Pr(T+\mid M+).
  • Spécificité : La probabilité qu’un test soit négatif chez les non-malades, Pr⁡(T−∣M−)\Pr(T-\mid M-).
  • Valeur prédictive positive : La probabilité d’être malade sachant que le test est positif, Pr⁡(M+∣T+)\Pr(M+\mid T+).

★ À maîtriser

📐 Formule — Pour deux événements A et B, Pr⁡(A∪B)=Pr⁡(A)+Pr⁡(B)−Pr⁡(A∩B)\Pr(A\cup B)=\Pr(A)+\Pr(B)-\Pr(A\cap B), et s’ils sont exclusifs, Pr⁡(A∪B)=Pr⁡(A)+Pr⁡(B)\Pr(A\cup B)=\Pr(A)+\Pr(B).

📐 Formule — La probabilité conditionnelle vérifie Pr⁡(A∣B)=Pr⁡(A∩B)Pr⁡(B)\Pr(A\mid B)=\frac{\Pr(A\cap B)}{\Pr(B)} lorsque Pr⁡(B)>0\Pr(B)>0.

📐 Formule — Le théorème de Bayes donne Pr⁡(A∣B)=Pr⁡(B∣A)Pr⁡(A)Pr⁡(B)\Pr(A\mid B)=\frac{\Pr(B\mid A)\Pr(A)}{\Pr(B)}.

📐 Formule — Deux événements A et B sont indépendants si Pr⁡(A∩B)=Pr⁡(A)Pr⁡(B)\Pr(A\cap B)=\Pr(A)\Pr(B), ce qui implique Pr⁡(A∣B)=Pr⁡(A)\Pr(A\mid B)=\Pr(A) et Pr⁡(B∣A)=Pr⁡(B)\Pr(B\mid A)=\Pr(B).

Compléments

📐 Formule — La valeur prédictive positive et la valeur prédictive négative vérifient respectivement VPP=Se peSe pe+(1−Sp)(1−pe)\mathrm{VPP}=\frac{Se\,pe}{Se\,pe+(1-Sp)(1-pe)} et VPN=Sp(1−pe)Sp(1−pe)+(1−Se)pe\mathrm{VPN}=\frac{Sp(1-pe)}{Sp(1-pe)+(1-Se)pe}.

  • Pour n rapports indépendants, si p est la probabilité de transmission par rapport, la probabilité d’être contaminé au moins une fois est 1−(1−p)n1-(1-p)^n.

Astuce mémo

Conditionner restreint l’univers ; Bayes inverse le conditionnement

7. Variables discrètes et lois usuelles

Notions clés & Définitions

  • Variable aléatoire discrète : Prend un ensemble dénombrable de valeurs auxquelles sont associées des probabilités.
  • Loi de Bernoulli : Une variable de Bernoulli décrit un événement binaire codé 1 avec probabilité p et 0 avec probabilité q=1-p ; elle vérifie E(X)=pE(X)=p et Var⁡(X)=pq\operatorname{Var}(X)=pq.

Points essentiels

📐 Formule — Une loi discrète est une loi de probabilité si chaque probabilité est comprise entre 0 et 1 et si ∑i=1KPr⁡(X=xi)=1\sum_{i=1}^{K}\Pr(X=x_i)=1.

📐 Formule — Pour une variable discrète, la fonction de répartition est F(x)=Pr⁡(X≤x)=∑xi≤xPr⁡(X=xi)F(x)=\Pr(X\le x)=\sum_{x_i\le x}\Pr(X=x_i).

📐 Formule — Pour une variable discrète, E(X)=∑ixiPr⁡(X=xi)E(X)=\sum_i x_i\Pr(X=x_i) et Var⁡(X)=∑iPr⁡(X=xi)(xi−E(X))2\operatorname{Var}(X)=\sum_i\Pr(X=x_i)(x_i-E(X))^2.

📐 Formule — Si X suit une loi binomiale de paramètres n et p, avec q=1-p, alors Pr⁡(X=x)=(nx)pxqn−x\Pr(X=x)=\binom{n}{x}p^xq^{n-x} pour x∈{0,1,…,n}x\in\{0{,}1,\ldots,n\}.

📐 Formule — Pour une loi binomiale B(n,p)B(n,p), l’espérance vaut E(X)=npE(X)=np et la variance vaut Var⁡(X)=npq\operatorname{Var}(X)=npq.

Astuce mémo

Bernoulli : un succès ; binomiale : plusieurs essais

8. Variables continues et loi normale

Notions clés & Définitions

  • Variable aléatoire continue : Peut prendre n’importe quelle valeur dans son domaine et possède une densité de probabilité f(x).
  • Loi normale : La loi normale N(m,s2)N(m,s^2) est une loi continue à densité en cloche, symétrique autour de m, dont la moyenne et la médiane valent m et dont la variance vaut s².

★ À maîtriser

📐 Formule — Pour une variable continue de densité f, Pr⁡(u≤X≤v)=∫uvf(x) dx\Pr(u\le X\le v)=\int_u^v f(x)\,dx.

📐 Formule — Une fonction f est une densité de probabilité si f(x)≥0f(x)\ge0 partout et si ∫Df(x) dx=1\int_D f(x)\,dx=1.

  • Pour standardiser une variable X∼N(m,s2)X\sim N(m,s^2), on pose Y=X−msY=\frac{X-m}{s}, qui suit une loi normale centrée réduite N(0,1)N(0{,}1).

Compléments

📐 Formule — Pour une variable continue, E(X)=∫Dxf(x) dxE(X)=\int_D xf(x)\,dx et Var⁡(X)=∫Df(x)(x−E(X))2 dx\operatorname{Var}(X)=\int_D f(x)(x-E(X))^2\,dx.

📐 Formule — La densité de la loi normale N(m,s2)N(m,s^2) est f(x)=12πs2exp⁡(−(x−m)22s2)f(x)=\frac{1}{\sqrt{2\pi s^2}}\exp\left(-\frac{(x-m)^2}{2s^2}\right).

Astuce mémo

La loi normale forme une cloche symétrique autour de sa moyenne

9. Sommes et associations statistiques

★ À maîtriser

📐 Formule — Pour deux variables aléatoires X et Y, Cov⁡(X,Y)=E(XY)−E(X)E(Y)\operatorname{Cov}(X,Y)=E(XY)-E(X)E(Y) et Var⁡(aX+bY)=a2Var⁡(X)+b2Var⁡(Y)+2abCov⁡(X,Y)\operatorname{Var}(aX+bY)=a^2\operatorname{Var}(X)+b^2\operatorname{Var}(Y)+2ab\operatorname{Cov}(X,Y).

📐 Formule — Si X et Y sont indépendantes, alors Var⁡(aX+bY)=a2Var⁡(X)+b2Var⁡(Y)\operatorname{Var}(aX+bY)=a^2\operatorname{Var}(X)+b^2\operatorname{Var}(Y).

📐 Formule — Si X1,…,Xn sont indépendantes, de même moyenne m et de variance s², alors leur moyenne suit approximativement, pour n suffisamment grand, 1n∑i=1nXi∼N(m,s2n)\frac{1}{n}\sum_{i=1}^nX_i\sim N\left(m,\frac{s^2}{n}\right).

📐 Formule — Dans un tableau de contingence, le risque relatif compare le risque d’un événement chez les exposés et les non-exposés : RR=Pr⁡(C∣F)Pr⁡(C∣F‾)RR=\frac{\Pr(C\mid F)}{\Pr(C\mid\overline F)}.

Compléments

  • En pratique, le théorème central limite est souvent considéré comme applicable lorsque n≥30n\ge30.

  • Dans l’exemple étudié, le risque de cancer est de 50 % chez les fumeurs et de 5 % chez les non-fumeurs, soit un risque relatif de 10 dans cet échantillon.

Astuce mémo

Indépendance → covariance nulle → variance additive

10. Risque relatif et odds ratio

Notions clés & Définitions

  • Facteur de confusion : Associé à la fois à deux variables et modifie le lien observé entre elles, pouvant en augmenter ou en diminuer l’amplitude, voire créer une association inexistante.

★ À maîtriser

📐 Formule — Le risque relatif du cancer chez les fumeurs par rapport aux non-fumeurs est RR=a/(a+c)b/(b+d)RR=\frac{a/(a+c)}{b/(b+d)}.

📐 Formule — L’odds ratio est le rapport des cotes et se calcule par OR=a/cb/d=adbcOR=\frac{a/c}{b/d}=\frac{ad}{bc}.

📌 Un RR ou un OR égal à 1 indique l’absence d’association mesurée, une valeur supérieure à 1 indique un facteur aggravant et une valeur inférieure à 1 indique un facteur protecteur.

📌 Quand RR est supérieur à 1, OR est supérieur à RR, et quand RR est inférieur à 1, OR est inférieur à RR.

  • Dans le tableau tabagisme-cancer, la proportion de cancer est de 0,5 chez les fumeurs (50/100) et de 0,05 chez les non-fumeurs (10/200).

  • L’écart entre OR et RR diminue lorsque la maladie est rare ou lorsque les deux mesures sont proches de 1; si la prévalence dépasse 20 % et que OR est supérieur à 2, il faut éviter d’interpréter OR comme RR.

Compléments

  • Dans l’exemple tabagisme-cancer, le risque relatif du cancer chez les fumeurs par rapport aux non-fumeurs vaut 10, tandis que le risque relatif d’être fumeur chez les cancéreux par rapport aux non-cancéreux vaut 4.

  • Dans l’exemple tabagisme-cancer, l’odds ratio vaut 19, et l’odds ratio calculé dans l’autre sens est également égal à 19.

📌 L’OR est l’inverse de l’OR de non-maladie, alors que le RR de non-maladie n’est généralement pas l’inverse du RR de maladie.

Astuce mémo

RR compare des risques, OR compare des cotes

11. Régression et corrélation linéaires

Notions clés & Définitions

  • Régression linéaire : Représente le lien entre une variable réponse y et une variable explicative x par une droite d’équation y=ax+by=ax+b.

★ À maîtriser

📐 Formule — Dans une régression linéaire, la pente et l’ordonnée à l’origine sont estimées par a=cov(x,y)var(x)a=\frac{cov(x,y)}{var(x)} et b=yˉ−axˉb=\bar y-a\bar x.

📐 Formule — La covariance est définie par cov(X,Y)=XY‾−XˉYˉcov(X,Y)=\overline{XY}-\bar X\bar Y et elle est positive lorsque X et Y ont tendance à varier dans le même sens.

📐 Formule — Le coefficient de corrélation linéaire de Pearson est ρX,Y=cov(X,Y)σXσY\rho_{X,Y}=\frac{cov(X,Y)}{\sigma_X\sigma_Y} et il est compris entre -1 et 1.

📌 Si la pente a est positive, Y augmente quand X augmente; si a est négative, Y diminue quand X augmente; une variation d’une unité de X entraîne une variation moyenne de a unités de Y.

📌 Une corrélation linéaire entre deux variables ne prouve pas que l’une est la cause de l’autre, car un facteur de confusion peut expliquer leur variation simultanée.

Compléments

  • Pour l’âge de la mère et le poids du nouveau-né, la droite de régression estimée est y=0,075x+1,18y=0{,}075x+1{,}18, avec une pente de 0,075 kg par an.

Astuce mémo

Variation de X → variation moyenne de Y

12. Variables quantitatives et qualitatives

★ À maîtriser

📐 Formule — Avec une variable qualitative binaire codée 0 et 1, le modèle est y=ax+by=ax+b, où b est la moyenne du groupe codé 0 et a est la différence moyenne entre les groupes codés 1 et 0.

  • Pour une variable qualitative à trois modalités, on choisit une catégorie de référence et on compare séparément chaque autre catégorie à cette référence.

📌 Dans une relation entre deux variables quantitatives, la variable explicative ou indépendante est notée x, tandis que la variable réponse ou dépendante est notée y.

Compléments

📌 Coder directement une variable nominale à trois modalités par les valeurs 0, 1 et 2 impose une égalité des écarts entre catégories qui n’est généralement pas justifiée.

  • Pour le poids selon le statut tabagique, la pente -4,6 kg signifie que le poids moyen des nouveau-nés de fumeuses diffère de 4,6 kg de celui des jamais-fumeuses dans le sens indiqué par le codage.

Astuce mémo

Codage 0-1 : b est le groupe 0, a est l’écart entre groupes

13. Échantillonnage et intervalles

Notions clés & Définitions

  • Fluctuation d’échantillonnage : Variation des résultats obtenus lorsque plusieurs échantillons sont tirés d’une même population.
  • Intervalle de pari : Le plus petit intervalle contenant la réalisation d’une variable d’échantillonnage avec une probabilité 1−α, lorsque les paramètres de la population sont connus.

★ À maîtriser

📐 Formule — Pour une moyenne et lorsque n est au moins égal à 30, l’intervalle de pari est [μ−zασ2n;μ+zασ2n]\left[\mu-z_\alpha\sqrt{\frac{\sigma^2}{n}};\mu+z_\alpha\sqrt{\frac{\sigma^2}{n}}\right].

  • Plus le niveau de confiance est élevé, plus l’intervalle de pari est large, tandis que son étendue diminue lorsque la taille de l’échantillon augmente.
  • L’échantillonnage prédit les résultats d’un échantillon à partir d’une population, l’estimation déduit les caractéristiques de la population à partir d’un échantillon, et le test compare des groupes ou une observation à une population théorique.

  • Un échantillon tiré au sort est représentatif, tandis qu’un échantillon obtenu par un tirage non aléatoire est biaisé.

  • L’intervalle de pari à 95 % a 95 % de chance de contenir le résultat d’un futur échantillon, tandis que l’intervalle de confiance à 95 % a 95 % de chance de contenir la vraie valeur de la population.

Compléments

  • Pour une prévalence de spina bifida de 1/1000 et un échantillon de 20000 grossesses, l’intervalle de pari à 95 % est [0,00078; 0,00122], soit entre 0,78 et 1,22 malformations pour 1000 grossesses.

Astuce mémo

Intervalle de pari : population → échantillon ; intervalle de confiance : échantillon → population

14. Intervalles de confiance

Notions clés & Définitions

  • Intervalle de confiance : Intervalle construit à partir d’un échantillon qui contient la valeur inconnue de la population avec une confiance fixée, notée généralement 1−α1-\alpha.

★ À maîtriser

📐 Formule — Pour une variance empirique so2s_o^2, l’estimateur sans biais de la variance est s^2=so2nn−1\hat{s}^2=s_o^2\frac{n}{n-1}.

📐 Formule — Pour une moyenne avec n<30n<30, une population normale et une variance inconnue, l’intervalle de confiance est IC1−α=[m^−tn−1,αs^n;m^+tn−1,αs^n]IC_{1-\alpha}=\left[\hat m-t_{n-1,\alpha}\frac{\hat s}{\sqrt n};\hat m+t_{n-1,\alpha}\frac{\hat s}{\sqrt n}\right].

📌 Pour l’intervalle de confiance d’une proportion, l’approximation normale est utilisable si npo≥5np_o\geq5 et n(1−po)≥5n(1-p_o)\geq5, avec IC1−α=[p^−zαp^q^n;p^+zαp^q^n]IC_{1-\alpha}=\left[\hat p-z_\alpha\sqrt{\frac{\hat p\hat q}{n}};\hat p+z_\alpha\sqrt{\frac{\hat p\hat q}{n}}\right].

📌 L’intervalle de Pari est construit à partir des valeurs dans la population et décrit la variabilité de la valeur observée, tandis que l’intervalle de confiance est construit à partir des estimations de l’échantillon et vise à contenir la vraie valeur de la population.

Compléments

📌 Pour n≥30n\geq30, on peut en pratique prendre s^2=so2\hat{s}^2=s_o^2, car pour n=30n=30 la correction ne produit qu’environ 3 % de différence.

Astuce mémo

Intervalle de Pari : valeur observée ; intervalle de confiance : vraie valeur de population

15. Principes des tests statistiques

Notions clés & Définitions

  • Hypothèse nulle : Hypothèse selon laquelle le hasard explique l’écart entre l’observation et la référence, ou entre les deux observations comparées.

Points essentiels

📐 Formule — La puissance statistique est la probabilité de rejeter H0H_0 lorsque H1H_1 est vraie, et vérifie Puissance=1−β\text{Puissance}=1-\beta.

  • Un test statistique consiste à poser H0H_0 et choisir α\alpha, collecter les données et calculer la statistique de test, déterminer sa loi sous H0H_0 et sa limite de rejet, puis comparer la statistique à cette limite pour décider de rejeter ou non H0H_0.

📌 Un test statistique compare soit une observation à une valeur théorique, soit deux observations entre elles, en tenant compte des fluctuations d’échantillonnage.

📌 L’erreur de type I consiste à rejeter H0H_0 alors qu’elle est vraie et correspond au risque de faux positif α\alpha, tandis que l’erreur de type II consiste à ne pas rejeter H0H_0 alors qu’elle est fausse et correspond au risque de faux négatif β\beta.

Astuce mémo

Écart observé → comparaison aux fluctuations du hasard → décision sur H0

16. Principaux tests statistiques

★ À maîtriser

📐 Formule — Pour comparer une proportion observée pop_o à une proportion théorique π\pi, la statistique est zo=po−ππ(1−π)/nz_o=\frac{p_o-\pi}{\sqrt{\pi(1-\pi)/n}}, et au seuil de 5 % on rejette H0H_0 si ∣zo∣>1,96|z_o|>1{,}96.

📐 Formule — Pour comparer une moyenne observée à une moyenne théorique, on utilise une statistique normale si n≥30n\geq30 et une statistique de Student à n−1n-1 degrés de liberté si n<30n<30, sous condition de normalité de la variable dans ce dernier cas.

📐 Formule — Pour un test du khi deux d’ajustement, la statistique est ∑i=1k(Oi−Ci)2Ci∼χk−12\sum_{i=1}^{k}\frac{(O_i-C_i)^2}{C_i}\sim\chi^2_{k-1}, où OiO_i est l’effectif observé et CiC_i l’effectif calculé sous H0H_0.

📌 Pour deux moyennes appariées, on analyse la moyenne des différences calculées sujet par sujet, tandis que pour deux groupes indépendants on compare directement les deux moyennes observées.

Compléments

📐 Formule — Pour comparer deux proportions observées, la statistique est zo=po1−po2poqo(1n1+1n2)z_o=\frac{p_{o1}-p_{o2}}{\sqrt{p_o q_o\left(\frac1{n_1}+\frac1{n_2}\right)}}, avec po=n1po1+n2po2n1+n2p_o=\frac{n_1p_{o1}+n_2p_{o2}}{n_1+n_2} et qo=1−poq_o=1-p_o.

📐 Formule — Pour le test du khi deux d’indépendance, les effectifs attendus sont Cij=xiyjNC_{ij}=\frac{x_i y_j}{N} et la statistique suit sous H0H_0 une loi χ(I−1)(J−1)2\chi^2_{(I-1)(J-1)}.

Astuce mémo

Proportion, moyenne, deux groupes, appariement, répartition

17. Données de survie censurées

Notions clés & Définitions

  • Variable de survie : Mesure le temps avant un événement, comme le décès ou la négativation d’une charge virale, même si l’événement n’est pas un décès.
  • Censure : Survient lorsque, à la date d’analyse, l’événement ne s’est pas encore produit ou que le patient est perdu de vue, de sorte que la durée exacte jusqu’à l’événement est inconnue.

★ À maîtriser

📐 Formule — La fonction de survie est S(t)=Pr⁡(T>t)=1−F(t)S(t)=\Pr(T>t)=1-F(t), où F(t)F(t) est la fonction de répartition de TT.

  • Pour caractériser une durée de survie, il faut deux variables : la durée TT et l’indicateur de censure CC, généralement égal à 1 si le patient fait l’événement et à 0 sinon.

Compléments

📌 La fonction de survie vérifie S(0)=1S(0)=1 et S(∞)=0S(\infty)=0, et elle est décroissante lorsque le temps augmente.

Astuce mémo

Une ligne de suivi s’arrête avant l’événement : la durée est censurée

18. Fonction et courbe de survie

Notions clés & Définitions

  • Temps de survie : Délai entre la date d’origine et la date d’événement ou, en cas de censure, la date de dernière nouvelle ou de fin de suivi.
  • Médiane de survie : La médiane de survie est le temps correspondant au 50e quantile, obtenu sur la courbe par S(t)=0,5 ; si cette valeur n’est pas exactement atteinte, on retient le plus petit temps vérifiant S(t)≥0,5.
  • Essai clinique : Recherche biomédicale organisée et pratiquée chez l’homme pour développer les connaissances biologiques ou médicales et évaluer une intervention.
  • Puissance : Probabilité de rejeter l’hypothèse nulle lorsqu’une différence réelle existe.

Points essentiels

📐 Formule — La fonction de survie vérifie S(t)=Pr(T>t)=1−F(t)S(t)=Pr(T>t)=1-F(t), où F(t) est la fonction de répartition de T.

📐 Formule — La régression linéaire s’écrit Y=aX+b+ϵY=aX+b+\epsilon et la prédiction pour un sujet i est y^i=axi+b\hat y_i=ax_i+b.

📐 Formule — L’erreur résiduelle d’un sujet i est ϵi=yi−axi−b\epsilon_i=y_i-ax_i-b et elle suit une loi normale de moyenne 0 et de variance σ².

📐 Formule — Les estimateurs des paramètres de la droite sont a^=Cov(X,Y)Var(X)\hat a=\frac{Cov(X,Y)}{Var(X)} et b^=yˉ−a^xˉ\hat b=\bar y-\hat a\bar x, et la droite passe par le point (mx,my).

📐 Formule — Le coefficient de détermination est R2=1−∑i=1n(yi−y^i)2∑i=1n(yi−yˉ)2R^2=1-\frac{\sum_{i=1}^{n}(y_i-\hat y_i)^2}{\sum_{i=1}^{n}(y_i-\bar y)^2} et représente la part de variabilité expliquée par le modèle.

📐 Formule — La régression linéaire multivariée s’écrit Y=∑k=1KakXk+b+ϵY=\sum_{k=1}^{K}a_kX_k+b+\epsilon ; chaque coefficient ak mesure l’effet propre de Xk sur Y toutes choses égales par ailleurs.

📌 Le tirage au sort répartit les facteurs de confusion connus et inconnus entre les groupes, de sorte que la différence observée puisse être attribuée au traitement si elle est statistiquement significative.

  • L’estimateur de Kaplan-Meier se construit période par période en calculant le risque de décès pk parmi les sujets vivants au début de chaque période, puis en actualisant la survie par S(tk)=(1−pk)S(tk−1)S(t_k)=(1-p_k)S(t_{k-1}) avec S(t0)=1.

  • La fonction de survie S(t) est décroissante, avec S(0)=1 et S(∞)=0.

📌 Sur une courbe de survie en marches d’escalier, chaque marche correspond à un événement tandis qu’un trait de censure ne modifie pas immédiatement la courbe.

📌 Une association statistique ne suffit pas à établir une causalité, car un facteur de confusion peut être associé à la fois à l’exposition et au résultat.

  • Le degré de signification ne mesure pas l’amplitude d’un lien, qui peut être quantifiée par le RR, l’OR ou la pente d’une régression.

Astuce mémo

Temps observé → survie → quantiles → médiane

Tableaux de synthèse

Types de variables

TypeCaractéristiqueExemple
QuantitativeValeurs numériques discrètes ou continuesNombre d’enfants, poids
Qualitative nominaleCatégories sans ordreCouleur des yeux
Qualitative ordinaleCatégories avec ordre naturelNiveau faible, moyen ou fort
CensuréeDurée avant un événement partiellement observéeTemps avant le décès

Indicateurs d’un test diagnostique

IndicateurExpressionPopulation de référence
SensibilitéPr(T+|M+)Malades
SpécificitéPr(T-|M-)Non-malades
VPPPr(M+|T+)Tests positifs
VPNPr(M-|T-)Tests négatifs

Teste tes connaissances

Teste tes connaissances sur Associations et estimation statistique avec 69 questions à choix multiples et corrections détaillées.

1. Quel domaine correspond à la biostatistique ?

2. Laquelle de ces utilisations relève notamment de la biostatistique en médecine ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Associations et estimation statistique avec 87 flashcards interactives.

Qu'est-ce que la biostatistique ?

La statistique appliquée aux sciences du vivant, à la biologie et à la médecine.

Que permet d'évaluer la biostatistique ?

Une valeur biologique normale, l’intérêt d’un examen, le risque d’une complication et l’efficacité comparative de traitements.

Quel est le rôle principal de la biostatistique dans l'observation ?

Passer de l’observation sur un échantillon à une généralisation sur une population plus large.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches