Fiche de révision : Fondements de biostatistique

Plan du Cours

  1. Rôle et variabilité en biostatistique
  2. Populations, échantillons et variables
  3. Description des variables quantitatives
  4. Événements et probabilités
  5. Probabilités conditionnelles et indépendance
  6. Tests diagnostiques et valeurs prédictives
  7. Lois discrètes et binomiale
  8. Lois continues et théorème central limite
  9. Risque relatif et odds ratio
  10. Régression et corrélation linéaires
  11. Variables qualitatives et quantitatives
  12. Échantillonnage et intervalles
  13. Intervalles de confiance
  14. Hypothèses et risques des tests
  15. Principe et principaux tests
  16. Données de survie censurées
  17. Analyse des courbes de survie
  18. Essais cliniques et causalité

1. Rôle et variabilité en biostatistique

Notions clés & Définitions

  • Biostatistique : Statistique appliquée aux sciences du vivant, à la biologie et à la médecine.
  • Épidémiologie : Science qui étudie, dans des populations humaines, animales ou végétales, la fréquence et la répartition des problèmes de santé dans le temps et dans l’espace ainsi que les facteurs qui les déterminent ou modifient le devenir des maladies.

Points essentiels

  • La biostatistique permet de généraliser les résultats observés sur un échantillon à une population plus large afin de faire progresser les connaissances médicales.

📌 La variabilité totale résulte de la variabilité biologique et de la variabilité métrologique, cette dernière correspondant à l’erreur due aux appareils de mesure.

📌 La variabilité biologique résulte de la variabilité intra-individuelle, observée chez un même individu, et de la variabilité inter-individuelle, observée entre différents individus.

Astuce mémo

Variabilité biologique et métrologique → incertitude → généralisation statistique

2. Populations, échantillons et variables

Notions clés & Définitions

  • Population : Ensemble des individus auquel on souhaite généraliser les conclusions d’une expérience et dont l’effectif est généralement très grand par rapport à celui de l’échantillon.
  • Échantillon : Sous-ensemble d’une population, qui peut être représentatif ou non de cette population.
  • Donnée censurée : Mesure une durée avant un événement alors que certains sujets n’ont pas encore connu cet événement au moment de l’analyse, et elle est décrite par une durée et un statut d’événement codé 1 ou 0.

Points essentiels

  • Un échantillon est représentatif de sa population s’il a été obtenu par tirage au sort, condition nécessaire et suffisante selon le cours.

  • Une variable aléatoire peut prendre plusieurs valeurs incertaines avant l’observation, tandis qu’une réalisation est la valeur effectivement observée pour un individu.

  • Les variables quantitatives sont des nombres et peuvent être discrètes ou continues, tandis que les variables qualitatives correspondent à l’appartenance à une catégorie nominale ou ordinale.

Astuce mémo

Population à généraliser, échantillon à observer

3. Description des variables quantitatives

Notions clés & Définitions

  • Fonction de répartition : Somme des fréquences des valeurs inférieures ou égales à a.
  • Médiane : Valeur qui coupe un échantillon ordonné en deux parties contenant chacune la moitié des valeurs, et pour un effectif pair elle est la moyenne des deux valeurs centrales.

★ À maîtriser

📐 Formule — Pour une variable quantitative regroupée en classes, la fréquence de la classe k vérifie fk=nknf_k = \frac{n_k}{n}, où n_k est son effectif et n l’effectif total.

📌 Dans un histogramme, la fréquence d’une classe est représentée par l’aire du rectangle, alors que dans un diagramme en bâtons elle est représentée par la hauteur de la barre.

📐 Formule — La moyenne empirique d’un échantillon de n valeurs est m=1ni=1nxim = \frac{1}{n}\sum_{i=1}^{n} x_i.

📐 Formule — La variance empirique mesure la dispersion autour de la moyenne et vérifie var(x)=1ni=1n(xim)2=moy(x2)m2\operatorname{var}(x)=\frac{1}{n}\sum_{i=1}^{n}(x_i-m)^2=\operatorname{moy}(x^2)-m^2.

Compléments

  • L’écart-type est la racine carrée de la variance et s’exprime dans la même unité que la variable.

Astuce mémo

Bâtons : hauteur ; histogramme : aire

4. Événements et probabilités

Notions clés & Définitions

  • Événement élémentaire : Événement qui ne peut pas être décomposé, tandis qu’un événement composé résulte d’une combinaison d’événements élémentaires.

★ À maîtriser

📌 Un phénomène déterministe donne le même résultat lorsqu’on répète l’expérience, tandis qu’un phénomène aléatoire produit des résultats variables dont la répartition est prévisible.

📌 Pour des événements exclusifs, la probabilité de leur réunion est la somme de leurs probabilités, et la probabilité de l’événement certain vaut 1 tandis que celle de l’événement impossible vaut 0.

📐 Formule — Pour deux événements A et B, Pr(A OU B)=Pr(A)+Pr(B)Pr(A ET B)\Pr(A\ \mathrm{OU}\ B)=\Pr(A)+\Pr(B)-\Pr(A\ \mathrm{ET}\ B).

📐 Formule — La probabilité conditionnelle de A sachant B vérifie Pr(AB)=Pr(A ET B)Pr(B)\Pr(A\mid B)=\frac{\Pr(A\ \mathrm{ET}\ B)}{\Pr(B)}.

📐 Formule — Le théorème de Bayes vérifie Pr(AB)=Pr(BA)Pr(A)Pr(B)\Pr(A\mid B)=\frac{\Pr(B\mid A)\Pr(A)}{\Pr(B)}.

Compléments

📌 Deux événements A et B sont indépendants si Pr(A ET B)=Pr(A)Pr(B)\Pr(A\ \mathrm{ET}\ B)=\Pr(A)\Pr(B), ce qui signifie que la réalisation de l’un ne modifie pas la probabilité de l’autre.

Astuce mémo

Épreuve → événement → probabilité → conditionnement

5. Probabilités conditionnelles et indépendance

Notions clés & Définitions

  • Probabilité conditionnelle : La probabilité conditionnelle de A sachant B est Pr(AB)=Pr(AB)Pr(B)Pr(A\mid B)=\frac{Pr(A\cap B)}{Pr(B)}, car l’ensemble de référence est restreint à B.
  • Indépendance : Deux événements A et B sont indépendants si Pr(AB)=Pr(A)Pr(B)Pr(A\cap B)=Pr(A)Pr(B), ce qui implique Pr(AB)=Pr(A)Pr(A\mid B)=Pr(A) et Pr(BA)=Pr(B)Pr(B\mid A)=Pr(B).

★ À maîtriser

📐 Formule — Pour deux événements A et B, les règles fondamentales sont Pr(AB)=Pr(A)+Pr(B)Pr(AB)Pr(A\cup B)=Pr(A)+Pr(B)-Pr(A\cap B), Pr(AB)=Pr(A)Pr(BA)=Pr(B)Pr(AB)Pr(A\cap B)=Pr(A)Pr(B\mid A)=Pr(B)Pr(A\mid B) et Pr(¬A)=1Pr(A)Pr(\neg A)=1-Pr(A).

📐 Formule — Le théorème de Bayes donne Pr(AB)=Pr(BA)Pr(A)Pr(B)Pr(A\mid B)=\frac{Pr(B\mid A)Pr(A)}{Pr(B)} et permet de calculer Pr(A|B) à partir de Pr(B|A), Pr(A) et Pr(B).

Compléments

  • Pour n rapports indépendants, si p est la probabilité d’une transmission par rapport, la probabilité d’être contaminé au moins une fois vaut 1(1p)n1-(1-p)^n.

📐 Formule — Si les événements Ai forment une partition complète, alors Pr(B)=iPr(BAi)Pr(Ai)Pr(B)=\sum_i Pr(B\mid A_i)Pr(A_i).

Astuce mémo

Conditionner restreint à B → Bayes inverse le conditionnement

6. Tests diagnostiques et valeurs prédictives

Notions clés & Définitions

  • Sensibilité : Se=Pr(T+M+)Se=Pr(T+\mid M+), c’est-à-dire la proportion de tests positifs parmi les sujets malades.
  • Spécificité : Sp=Pr(TM)Sp=Pr(T-\mid M-), c’est-à-dire la probabilité d’identifier correctement les sujets non malades.

★ À maîtriser

📌 La valeur prédictive positive est VPP=Pr(M+T+)VPP=Pr(M+\mid T+), tandis que la valeur prédictive négative est VPN=Pr(MT)VPN=Pr(M-\mid T-).

📐 Formule — Avec la prévalence pe, la sensibilité Se et la spécificité Sp, VPP=SepeSepe+(1Sp)(1pe)VPP=\frac{Se\,pe}{Se\,pe+(1-Sp)(1-pe)} et VPN=Sp(1pe)Sp(1pe)+(1Se)peVPN=\frac{Sp(1-pe)}{Sp(1-pe)+(1-Se)pe}.

Compléments

  • Dans l’exemple de 100 malades et 100 non-malades, 80 malades sont T+ et 10 non-malades sont T+, donnant une sensibilité de 0,8 et une spécificité de 0,9.

Astuce mémo

Sensibilité chez les malades, spécificité chez les non-malades

7. Lois discrètes et binomiale

Notions clés & Définitions

  • Variable aléatoire discrète : Prend des valeurs dénombrables xi auxquelles correspondent des probabilités Pr(xi), dont la somme vaut 1.
  • Loi de Bernoulli : Une variable de Bernoulli codée 1 pour l’événement e et 0 pour son complément suit Be(p), avec Pr(X=1)=pPr(X=1)=p, E(X)=pE(X)=p et Var(X)=p(1p)Var(X)=p(1-p).

Points essentiels

📐 Formule — La fonction de répartition d’une variable discrète est F(x)=Pr(Xx)=xixPr(X=xi)F(x)=Pr(X\le x)=\sum_{x_i\le x}Pr(X=x_i).

📐 Formule — Pour une variable discrète, E(X)=iPr(X=xi)xiE(X)=\sum_i Pr(X=x_i)x_i et Var(X)=iPr(X=xi)(xiE(X))2Var(X)=\sum_i Pr(X=x_i)(x_i-E(X))^2.

📐 Formule — Si X compte les succès de n réalisations indépendantes de probabilité p, alors X suit une loi binomiale B(n,p) et Pr(X=x)=(nx)px(1p)nxPr(X=x)=\binom{n}{x}p^x(1-p)^{n-x}, avec E(X)=npE(X)=np et Var(X)=np(1p)Var(X)=np(1-p).

Astuce mémo

Bernoulli → somme indépendante → binomiale

8. Lois continues et théorème central limite

Notions clés & Définitions

  • Densité de probabilité : Pour une variable continue X de densité f, la probabilité d’un intervalle [u,v] est Pr(uXv)=uvf(x)dxPr(u\le X\le v)=\int_u^v f(x)dx, avec f(x) positive ou nulle et d’intégrale totale égale à 1.
  • Loi normale : La loi normale N(m,s²) est une loi continue de densité f(x)=12πs2exp((xm)22s2)f(x)=\frac{1}{\sqrt{2\pi s^2}}\exp\left(-\frac{(x-m)^2}{2s^2}\right), symétrique autour de m, avec moyenne m, variance s² et écart-type s.

★ À maîtriser

📐 Formule — Pour une variable continue de densité f, F(x)=Pr(Xx)=xf(v)dvF(x)=Pr(X\le x)=\int_{-\infty}^{x}f(v)dv et E(X)=Dxf(x)dxE(X)=\int_D xf(x)dx.

📐 Formule — Si X suit N(m,s²), alors la variable centrée réduite Y=XmsY=\frac{X-m}{s} suit N(0,1), et F(x)=1F(x)F(-x)=1-F(x).

📐 Formule — Si n variables indépendantes de même moyenne m et variance s² sont considérées avec n suffisamment grand, leur moyenne suit approximativement N(m,s2n)N\left(m,\frac{s^2}{n}\right) et son erreur standard vaut sn\frac{s}{\sqrt n}.

Compléments

📌 En pratique, le théorème central limite est souvent considéré comme applicable lorsque n≥30, même si la loi individuelle n’est pas normale.

Astuce mémo

Une cloche normale centrée autour de la moyenne, resserrée quand n augmente

9. Risque relatif et odds ratio

Notions clés & Définitions

  • Facteur de confusion : Facteur associé à la fois à deux variables étudiées et qui modifie le lien observé entre elles, pouvant amplifier, réduire ou créer une association apparente.

★ À maîtriser

  • Dans le tableau tabagisme-cancer, la proportion de cancer est de 0,5 chez les fumeurs et de 0,05 chez les non-fumeurs.

📐 Formule — Le risque relatif du cancer chez les fumeurs par rapport aux non-fumeurs est RR=a/(a+c)b/(b+d)RR=\frac{a/(a+c)}{b/(b+d)}.

  • Dans l’exemple tabagisme-cancer, le risque relatif vaut 10, ce qui signifie que le cancer est dix fois plus fréquent chez les fumeurs que chez les non-fumeurs dans cet échantillon.

📐 Formule — L’odds ratio est le rapport des cotes et se calcule par OR=a/cb/d=adbcOR=\frac{a/c}{b/d}=\frac{ad}{bc}.

📌 Un RR ou un OR égal à 1 indique l’absence d’association mesurée, une valeur supérieure à 1 indique un facteur aggravant et une valeur inférieure à 1 indique un facteur protecteur.

📌 L’odds ratio exagère l’effet par rapport au risque relatif, sauf lorsqu’ils sont égaux à 1, et l’écart entre eux diminue lorsque la maladie est rare ou que les deux mesures sont proches de 1.

Compléments

  • Dans l’exemple tabagisme-cancer, l’odds ratio vaut 19, alors que le risque relatif vaut 10.

Astuce mémo

RR compare les risques ; OR compare les cotes

10. Régression et corrélation linéaires

★ À maîtriser

📌 En régression, la variable explicative ou indépendante est notée X, tandis que la variable réponse ou dépendante est notée Y et est étudiée selon X.

📐 Formule — Le modèle de régression linéaire représente le lien entre les variables par y=ax+by=ax+b.

📐 Formule — La pente de la droite de régression vérifie a=cov(x,y)var(x)a=\frac{cov(x,y)}{var(x)} et l’ordonnée à l’origine vérifie b=yˉaxˉb=\bar y-a\bar x.

📌 Si la pente a est positive, Y augmente quand X augmente ; si a est négative, Y diminue quand X augmente ; une variation d’une unité de X entraîne une variation moyenne de a unités de Y.

📐 Formule — Le coefficient de corrélation linéaire de Pearson est ρX,Y=cov(X,Y)σXσY\rho_{X,Y}=\frac{cov(X,Y)}{\sigma_X\sigma_Y} et appartient toujours à l’intervalle [1,1][-1{,}1].

Compléments

  • Pour l’âge de la mère et le poids du nouveau-né, la droite de régression obtenue est y=0,075x+1,18y=0{,}075x+1{,}18, où la pente est exprimée en kilogrammes par an.

Astuce mémo

Variation de X → variation moyenne de Y

11. Variables qualitatives et quantitatives

★ À maîtriser

📌 Quand une variable qualitative à deux modalités est codée 0 et 1 dans le modèle y=ax+by=ax+b, la pente a représente la différence entre les moyennes de Y des deux modalités.

  • Pour une variable qualitative à trois modalités, on choisit une catégorie de référence et on estime un coefficient pour chaque comparaison avec cette référence.

📌 Coder directement une variable nominale à trois modalités par les valeurs ordinales 0, 1 et 2 impose artificiellement une même différence entre les catégories et doit être évité sans justification forte.

Compléments

  • Dans l’exemple du poids selon le statut tabagique, la pente vaut −4,6 kg et représente la différence moyenne de poids entre les fumeuses et les jamais fumeuses.

Astuce mémo

Codage 0-1 : l’ordonnée donne une moyenne, la pente une différence

12. Échantillonnage et intervalles

Notions clés & Définitions

  • Fluctuation d’échantillonnage : Variation des résultats obtenus lorsque plusieurs échantillons différents sont tirés d’une même population.
  • Intervalle de pari : Plus petit intervalle contenant une réalisation future avec la probabilité 1−α lorsque les paramètres de la population sont connus.

★ À maîtriser

  • L’échantillonnage prédit les résultats d’un échantillon à partir de la population, l’estimation déduit les caractéristiques de la population à partir de l’échantillon et le test compare des groupes ou une observation à une population théorique.

  • Un échantillon représentatif est obtenu par tirage au sort et ses différences avec la population reflètent le hasard, tandis qu’un échantillon biaisé n’est pas tiré au hasard et peut mal représenter la population.

  • La largeur d’un intervalle de pari augmente avec le niveau de confiance et diminue lorsque la taille de l’échantillon augmente.

Compléments

📐 Formule — Pour une proportion et lorsque nπ5n\pi\geq5, l’intervalle de pari de niveau 1−α est [πzαπ(1π)n ; π+zαπ(1π)n]\left[\pi-z_\alpha\sqrt{\frac{\pi(1-\pi)}{n}}\ ;\ \pi+z_\alpha\sqrt{\frac{\pi(1-\pi)}{n}}\right].

Astuce mémo

Échantillonnage → estimation → test

13. Intervalles de confiance

Notions clés & Définitions

  • Intervalle de confiance : Intervalle construit à partir d’un échantillon qui, avec une confiance donnée, contient la vraie valeur inconnue de la population.

★ À maîtriser

📌 L’intervalle de pari, construit à partir des valeurs de la population, a une probabilité donnée de contenir la valeur observée sur un échantillon, tandis que l’intervalle de confiance, construit à partir des estimations de l’échantillon, a une probabilité donnée de contenir la vraie valeur de la population.

📐 Formule — L’estimateur sans biais de la variance est s^2=so2nn1\hat{s}^2=s_o^2\frac{n}{n-1}.

📐 Formule — Pour n < 30 et une variance inconnue, sous l’hypothèse de normalité, l’intervalle de confiance d’une moyenne est IC1α=[m^tn1,αs^n;m^+tn1,αs^n]IC_{1-\alpha}=\left[\hat m-t_{n-1,\alpha}\frac{\hat s}{\sqrt n};\hat m+t_{n-1,\alpha}\frac{\hat s}{\sqrt n}\right].

📐 Formule — Lorsque n\hat p ≥ 5 et n(1-\hat p) ≥ 5, l’intervalle de confiance d’une proportion est IC1α=[p^zαp^q^n;p^+zαp^q^n]IC_{1-\alpha}=\left[\hat p-z_\alpha\sqrt{\frac{\hat p\hat q}{n}};\hat p+z_\alpha\sqrt{\frac{\hat p\hat q}{n}}\right], avec \hat q=1-\hat p.

Compléments

📌 Pour n ≥ 30, on peut en pratique assimiler l’estimateur de variance \hat{s}^2 à la variance empirique s_o^2, car leur différence est faible.

Astuce mémo

Intervalle de pari : valeur observée ; intervalle de confiance : vraie valeur

14. Hypothèses et risques des tests

★ À maîtriser

📌 L’hypothèse nulle H0 représente l’absence de différence attribuable à autre chose que le hasard, tandis que l’hypothèse alternative H1 représente l’existence d’une différence ou d’un effet.

📌 L’erreur de type I consiste à rejeter H0 alors qu’elle est vraie et sa probabilité est notée α, tandis que l’erreur de type II consiste à ne pas rejeter H0 alors qu’elle est fausse et sa probabilité est notée β.

📐 Formule — La puissance statistique d’un test est 1β=Pr(rejet de H0H1 vraie)1-\beta=\Pr(\text{rejet de }H_0\mid H_1\text{ vraie}).

Compléments

  • Dans la majorité des tests, on fixe α à 0,05 et β entre 0,1 et 0,2, ce qui correspond à une puissance comprise entre 80 % et 90 %.

Astuce mémo

Écart observé → hasard ou rejet de H0

15. Principe et principaux tests

★ À maîtriser

  • 🔄 Un test statistique suit quatre étapes:
    1. Poser H0 et choisir le risque α
    2. Recueillir les données et calculer la statistique de test
    3. Déterminer la loi sous H0 et la limite de rejet
    4. Comparer la statistique à la limite et décider

📐 Formule — Pour comparer une proportion observée à une proportion théorique, la statistique est zo=poππ(1π)/nz_o=\frac{p_o-\pi}{\sqrt{\pi(1-\pi)/n}} et, au seuil bilatéral de 5 %, on rejette H0 si zo>1,96|z_o|>1{,}96.

📐 Formule — Pour comparer deux proportions observées, la statistique est zo=po1po2poqo(1n1+1n2)z_o=\frac{p_{o1}-p_{o2}}{\sqrt{p_o q_o\left(\frac{1}{n_1}+\frac{1}{n_2}\right)}} avec po=n1po1+n2po2n1+n2p_o=\frac{n_1p_{o1}+n_2p_{o2}}{n_1+n_2} et q_o=1-p_o.

📌 Pour des données appariées, on calcule la moyenne des différences entre les deux mesures chez chaque sujet, tandis que pour des groupes indépendants on compare directement les deux moyennes.

📐 Formule — Le test du χ² d’ajustement compare une répartition observée à une répartition théorique avec i=1k(OiCi)2Ciχk12\sum_{i=1}^{k}\frac{(O_i-C_i)^2}{C_i}\sim\chi^2_{k-1}, sous la condition que tous les effectifs calculés C_i soient au moins égaux à 5.

Compléments

📐 Formule — Pour comparer deux moyennes indépendantes avec au moins un petit échantillon, la statistique suit une loi de Student à n_1+n_2-2 degrés de liberté et utilise la variance poolée so2=(n11)so12+(n21)so22n1+n22s_o^2=\frac{(n_1-1)s_{o1}^2+(n_2-1)s_{o2}^2}{n_1+n_2-2}.

Astuce mémo

H0 → données → limite de rejet → décision

16. Données de survie censurées

Notions clés & Définitions

  • Variable de survie : Mesure le temps avant la survenue d’un événement, qui peut être un décès, une négativation virale ou la fin d’une infection.
  • Censure : Survient lorsque, au moment de l’analyse, l’événement étudié ne s’est pas encore produit ou que le patient est perdu de vue.

Points essentiels

  • Pour caractériser une durée de survie, il faut la durée T et l’indicateur de censure C, qui vaut typiquement 1 si le patient a eu l’événement et 0 sinon.

📐 Formule — La fonction de survie est S(t)=Pr(T>t)=1F(t)S(t)=\Pr(T>t)=1-F(t), où F(t) est la fonction de répartition de T.

Astuce mémo

Une ligne du suivi s’arrête avant l’événement : c’est la censure

17. Analyse des courbes de survie

Notions clés & Définitions

  • Fonction de survie : La probabilité qu’un patient vive plus longtemps qu’une durée t, soit S(t)=Pr(T>t)=1F(t)S(t)=\Pr(T>t)=1-F(t).
  • Médiane de survie : Le temps correspondant au 50e quantile, déterminé sur la courbe par S(t)=0,5 ; dans l’exemple, elle est atteinte à 56 jours.

Points essentiels

  • La fonction de survie vérifie S(0)=1, tend vers 0 lorsque t tend vers l’infini et est décroissante au cours du temps.

📌 À 30 jours, un taux de survie de 75 % s’écrit S(30)=0,75, tandis que le taux de décès avant 90 jours vaut 1−S(90)=0,78 lorsque S(90)=0,22.

  • L’estimateur de Kaplan-Meier se construit période par période en calculant le risque de décès pk parmi les sujets vivants au début de chaque période, puis en appliquant S(tk)=(1pk)S(tk1)S(t_k)=(1-p_k)S(t_{k-1}) avec S(t0)=1.

Astuce mémo

Temps observé → survie → quantiles → Kaplan-Meier

18. Essais cliniques et causalité

Notions clés & Définitions

  • Essai clinique : Une recherche biomédicale organisée et pratiquée chez l’être humain pour développer des connaissances biologiques ou médicales et évaluer une intervention.
  • Erreur résiduelle : L’écart entre la valeur observée et sa prédiction par la droite de régression, soit ϵi=yiaxib\epsilon_i=y_i-ax_i-b.
  • Écart réduit : La probabilité 2(1F(x))2(1-F(x)) que la variable soit supérieure ou égale à x en valeur absolue.
  • Loi du Chi-deux : Somme des carrés de n variables aléatoires indépendantes suivant une loi normale centrée réduite.
  • Table de Student : Donne, pour chaque degré de liberté et chaque valeur x, la probabilité qu’une variable de Student dépasse x en valeur absolue.
  • Loi binomiale : Décrit le nombre de succès obtenus lors de n tirages indépendants ayant chacun une probabilité p de succès.

Points essentiels

📌 Une étude observationnelle mesure des phénomènes sans intervention, tandis qu’une étude expérimentale impose une contrainte aux sujets, comme recevoir un médicament.

  • Un essai randomisé attribue les traitements par tirage au sort après consentement éclairé, afin de rendre les groupes similaires pour les facteurs de confusion connus et inconnus.

📌 Le degré de signification mesure la compatibilité d’une différence avec le hasard, tandis que l’amplitude du lien se quantifie par des mesures comme le RR, l’OR ou la pente d’une régression.

📐 Formule — La régression linéaire univariée s’écrit Y=aX+b+ϵY=aX+b+\epsilon, et la prédiction pour un sujet i est y^i=axi+b\hat y_i=ax_i+b.

📐 Formule — Les estimations des paramètres de la droite vérifient a^=cov(X,Y)Var(X)\hat a=\frac{\operatorname{cov}(X,Y)}{\operatorname{Var}(X)} et b^=yˉa^xˉ\hat b=\bar y-\hat a\bar x.

📐 Formule — Le coefficient de détermination est R2=1i=1n(yiy^i)2i=1n(yiyˉ)2R^2=1-\frac{\sum_{i=1}^n(y_i-\hat y_i)^2}{\sum_{i=1}^n(y_i-\bar y)^2} et mesure la part de variabilité de Y expliquée par le modèle.

📐 Formule — La régression linéaire multivariée s’écrit Y=k=1KakXk+b+ϵY=\sum_{k=1}^{K}a_kX_k+b+\epsilon, où chaque coefficient ak mesure l’effet propre de Xk lorsque les autres variables restent constantes.

  • Pour x=1,96 dans la loi normale centrée réduite, F(x)=0,9750 et l’écart réduit vaut 0,05, soit 5 %.

📌 L’espérance E(X) est la moyenne théorique d’une variable aléatoire, tandis que moy(x) est la moyenne des observations d’un échantillon.

📌 La variance Var(X) décrit la dispersion théorique d’une variable aléatoire, tandis que s² désigne la variance des observations.

Astuce mémo

Tirage au sort → facteurs équilibrés → interprétation causale

Tableaux de synthèse

Types de variables

TypeSous-typeCaractéristique
QuantitativeDiscrète ou continueValeur numérique
QualitativeNominaleCatégories sans ordre
QualitativeOrdinaleCatégories avec ordre naturel
CensuréeDurée et statutTemps avant un événement partiellement observé

Mesures d’association

MesureInterprétationValeur nulle
Risque relatifRapport de deux risquesRR=1
Odds ratioRapport de deux cotesOR=1

Teste tes connaissances

Teste tes connaissances sur Fondements de biostatistique avec 11 questions à choix multiples et corrections détaillées.

1. Quel domaine la biostatistique applique-t-elle principalement aux sciences du vivant, à la biologie et à la médecine ?

2. Qu'est-ce que la biostatistique ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Fondements de biostatistique avec 11 flashcards interactives.

Qu'est-ce que la biostatistique ?

La statistique appliquée aux sciences du vivant, à la biologie et à la médecine.

Biostatistique : définition

Statistique appliquée aux sciences du vivant.

De quoi résulte la variabilité totale en biostatistique ?

De la variabilité biologique et de la variabilité métrologique.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches