Biostatistique : Statistique appliquée aux sciences du vivant, à la biologie et à la médecine.
Épidémiologie : Science qui étudie, dans des populations humaines, animales ou végétales, la fréquence et la répartition des problèmes de santé dans le temps et dans l’espace ainsi que les facteurs qui les déterminent ou modifient le devenir des maladies.
📝 Points essentiels
La biostatistique permet de généraliser les résultats observés sur un échantillon à une population plus large afin de faire progresser les connaissances médicales.
📌 La variabilité totale résulte de la variabilité biologique et de la variabilité métrologique, cette dernière correspondant à l’erreur due aux appareils de mesure.
📌 La variabilité biologique résulte de la variabilité intra-individuelle, observée chez un même individu, et de la variabilité inter-individuelle, observée entre différents individus.
💡 Astuce mémo
Variabilité biologique et métrologique → incertitude → généralisation statistique
📖 2. Populations, échantillons et variables
🔑 Notions clés & Définitions
Population : Ensemble des individus auquel on souhaite généraliser les conclusions d’une expérience et dont l’effectif est généralement très grand par rapport à celui de l’échantillon.
Échantillon : Sous-ensemble d’une population, qui peut être représentatif ou non de cette population.
Donnée censurée : Mesure une durée avant un événement alors que certains sujets n’ont pas encore connu cet événement au moment de l’analyse, et elle est décrite par une durée et un statut d’événement codé 1 ou 0.
📝 Points essentiels
Un échantillon est représentatif de sa population s’il a été obtenu par tirage au sort, condition nécessaire et suffisante selon le cours.
Une variable aléatoire peut prendre plusieurs valeurs incertaines avant l’observation, tandis qu’une réalisation est la valeur effectivement observée pour un individu.
Les variables quantitatives sont des nombres et peuvent être discrètes ou continues, tandis que les variables qualitatives correspondent à l’appartenance à une catégorie nominale ou ordinale.
💡 Astuce mémo
Population à généraliser, échantillon à observer
📖 3. Description des variables quantitatives
🔑 Notions clés & Définitions
Fonction de répartition : Somme des fréquences des valeurs inférieures ou égales à a.
Médiane : Valeur qui coupe un échantillon ordonné en deux parties contenant chacune la moitié des valeurs, et pour un effectif pair elle est la moyenne des deux valeurs centrales.
★ À maîtriser
📐 Formule — Pour une variable quantitative regroupée en classes, la fréquence de la classe k vérifie fk=nnk, où n_k est son effectif et n l’effectif total.
📌 Dans un histogramme, la fréquence d’une classe est représentée par l’aire du rectangle, alors que dans un diagramme en bâtons elle est représentée par la hauteur de la barre.
📐 Formule — La moyenne empirique d’un échantillon de n valeurs est m=n1∑i=1nxi.
📐 Formule — La variance empirique mesure la dispersion autour de la moyenne et vérifie var(x)=n1∑i=1n(xi−m)2=moy(x2)−m2.
Compléments
L’écart-type est la racine carrée de la variance et s’exprime dans la même unité que la variable.
💡 Astuce mémo
Bâtons : hauteur ; histogramme : aire
📖 4. Événements et probabilités
🔑 Notions clés & Définitions
Événement élémentaire : Événement qui ne peut pas être décomposé, tandis qu’un événement composé résulte d’une combinaison d’événements élémentaires.
★ À maîtriser
📌 Un phénomène déterministe donne le même résultat lorsqu’on répète l’expérience, tandis qu’un phénomène aléatoire produit des résultats variables dont la répartition est prévisible.
📌 Pour des événements exclusifs, la probabilité de leur réunion est la somme de leurs probabilités, et la probabilité de l’événement certain vaut 1 tandis que celle de l’événement impossible vaut 0.
📐 Formule — Pour deux événements A et B, Pr(AOUB)=Pr(A)+Pr(B)−Pr(AETB).
📐 Formule — La probabilité conditionnelle de A sachant B vérifie Pr(A∣B)=Pr(B)Pr(AETB).
📐 Formule — Le théorème de Bayes vérifie Pr(A∣B)=Pr(B)Pr(B∣A)Pr(A).
Compléments
📌 Deux événements A et B sont indépendants si Pr(AETB)=Pr(A)Pr(B), ce qui signifie que la réalisation de l’un ne modifie pas la probabilité de l’autre.
Probabilité conditionnelle : La probabilité conditionnelle de A sachant B est Pr(A∣B)=Pr(B)Pr(A∩B), car l’ensemble de référence est restreint à B.
Indépendance : Deux événements A et B sont indépendants si Pr(A∩B)=Pr(A)Pr(B), ce qui implique Pr(A∣B)=Pr(A) et Pr(B∣A)=Pr(B).
★ À maîtriser
📐 Formule — Pour deux événements A et B, les règles fondamentales sont Pr(A∪B)=Pr(A)+Pr(B)−Pr(A∩B), Pr(A∩B)=Pr(A)Pr(B∣A)=Pr(B)Pr(A∣B) et Pr(¬A)=1−Pr(A).
📐 Formule — Le théorème de Bayes donne Pr(A∣B)=Pr(B)Pr(B∣A)Pr(A) et permet de calculer Pr(A|B) à partir de Pr(B|A), Pr(A) et Pr(B).
Compléments
Pour n rapports indépendants, si p est la probabilité d’une transmission par rapport, la probabilité d’être contaminé au moins une fois vaut 1−(1−p)n.
📐 Formule — Si les événements Ai forment une partition complète, alors Pr(B)=∑iPr(B∣Ai)Pr(Ai).
💡 Astuce mémo
Conditionner restreint à B → Bayes inverse le conditionnement
📖 6. Tests diagnostiques et valeurs prédictives
🔑 Notions clés & Définitions
Sensibilité : Se=Pr(T+∣M+), c’est-à-dire la proportion de tests positifs parmi les sujets malades.
Spécificité : Sp=Pr(T−∣M−), c’est-à-dire la probabilité d’identifier correctement les sujets non malades.
★ À maîtriser
📌 La valeur prédictive positive est VPP=Pr(M+∣T+), tandis que la valeur prédictive négative est VPN=Pr(M−∣T−).
📐 Formule — Avec la prévalence pe, la sensibilité Se et la spécificité Sp, VPP=Sepe+(1−Sp)(1−pe)Sepe et VPN=Sp(1−pe)+(1−Se)peSp(1−pe).
Compléments
Dans l’exemple de 100 malades et 100 non-malades, 80 malades sont T+ et 10 non-malades sont T+, donnant une sensibilité de 0,8 et une spécificité de 0,9.
💡 Astuce mémo
Sensibilité chez les malades, spécificité chez les non-malades
📖 7. Lois discrètes et binomiale
🔑 Notions clés & Définitions
Variable aléatoire discrète : Prend des valeurs dénombrables xi auxquelles correspondent des probabilités Pr(xi), dont la somme vaut 1.
Loi de Bernoulli : Une variable de Bernoulli codée 1 pour l’événement e et 0 pour son complément suit Be(p), avec Pr(X=1)=p, E(X)=p et Var(X)=p(1−p).
📝 Points essentiels
📐 Formule — La fonction de répartition d’une variable discrète est F(x)=Pr(X≤x)=∑xi≤xPr(X=xi).
📐 Formule — Pour une variable discrète, E(X)=∑iPr(X=xi)xi et Var(X)=∑iPr(X=xi)(xi−E(X))2.
📐 Formule — Si X compte les succès de n réalisations indépendantes de probabilité p, alors X suit une loi binomiale B(n,p) et Pr(X=x)=(xn)px(1−p)n−x, avec E(X)=np et Var(X)=np(1−p).
💡 Astuce mémo
Bernoulli → somme indépendante → binomiale
📖 8. Lois continues et théorème central limite
🔑 Notions clés & Définitions
Densité de probabilité : Pour une variable continue X de densité f, la probabilité d’un intervalle [u,v] est Pr(u≤X≤v)=∫uvf(x)dx, avec f(x) positive ou nulle et d’intégrale totale égale à 1.
Loi normale : La loi normale N(m,s²) est une loi continue de densité f(x)=2πs21exp(−2s2(x−m)2), symétrique autour de m, avec moyenne m, variance s² et écart-type s.
★ À maîtriser
📐 Formule — Pour une variable continue de densité f, F(x)=Pr(X≤x)=∫−∞xf(v)dv et E(X)=∫Dxf(x)dx.
📐 Formule — Si X suit N(m,s²), alors la variable centrée réduite Y=sX−m suit N(0,1), et F(−x)=1−F(x).
📐 Formule — Si n variables indépendantes de même moyenne m et variance s² sont considérées avec n suffisamment grand, leur moyenne suit approximativement N(m,ns2) et son erreur standard vaut ns.
Compléments
📌 En pratique, le théorème central limite est souvent considéré comme applicable lorsque n≥30, même si la loi individuelle n’est pas normale.
💡 Astuce mémo
Une cloche normale centrée autour de la moyenne, resserrée quand n augmente
📖 9. Risque relatif et odds ratio
🔑 Notions clés & Définitions
Facteur de confusion : Facteur associé à la fois à deux variables étudiées et qui modifie le lien observé entre elles, pouvant amplifier, réduire ou créer une association apparente.
★ À maîtriser
Dans le tableau tabagisme-cancer, la proportion de cancer est de 0,5 chez les fumeurs et de 0,05 chez les non-fumeurs.
📐 Formule — Le risque relatif du cancer chez les fumeurs par rapport aux non-fumeurs est RR=b/(b+d)a/(a+c).
Dans l’exemple tabagisme-cancer, le risque relatif vaut 10, ce qui signifie que le cancer est dix fois plus fréquent chez les fumeurs que chez les non-fumeurs dans cet échantillon.
📐 Formule — L’odds ratio est le rapport des cotes et se calcule par OR=b/da/c=bcad.
📌 Un RR ou un OR égal à 1 indique l’absence d’association mesurée, une valeur supérieure à 1 indique un facteur aggravant et une valeur inférieure à 1 indique un facteur protecteur.
📌 L’odds ratio exagère l’effet par rapport au risque relatif, sauf lorsqu’ils sont égaux à 1, et l’écart entre eux diminue lorsque la maladie est rare ou que les deux mesures sont proches de 1.
Compléments
Dans l’exemple tabagisme-cancer, l’odds ratio vaut 19, alors que le risque relatif vaut 10.
💡 Astuce mémo
RR compare les risques ; OR compare les cotes
📖 10. Régression et corrélation linéaires
★ À maîtriser
📌 En régression, la variable explicative ou indépendante est notée X, tandis que la variable réponse ou dépendante est notée Y et est étudiée selon X.
📐 Formule — Le modèle de régression linéaire représente le lien entre les variables par y=ax+b.
📐 Formule — La pente de la droite de régression vérifie a=var(x)cov(x,y) et l’ordonnée à l’origine vérifie b=yˉ−axˉ.
📌 Si la pente a est positive, Y augmente quand X augmente ; si a est négative, Y diminue quand X augmente ; une variation d’une unité de X entraîne une variation moyenne de a unités de Y.
📐 Formule — Le coefficient de corrélation linéaire de Pearson est ρX,Y=σXσYcov(X,Y) et appartient toujours à l’intervalle [−1,1].
Compléments
Pour l’âge de la mère et le poids du nouveau-né, la droite de régression obtenue est y=0,075x+1,18, où la pente est exprimée en kilogrammes par an.
💡 Astuce mémo
Variation de X → variation moyenne de Y
📖 11. Variables qualitatives et quantitatives
★ À maîtriser
📌 Quand une variable qualitative à deux modalités est codée 0 et 1 dans le modèle y=ax+b, la pente a représente la différence entre les moyennes de Y des deux modalités.
Pour une variable qualitative à trois modalités, on choisit une catégorie de référence et on estime un coefficient pour chaque comparaison avec cette référence.
📌 Coder directement une variable nominale à trois modalités par les valeurs ordinales 0, 1 et 2 impose artificiellement une même différence entre les catégories et doit être évité sans justification forte.
Compléments
Dans l’exemple du poids selon le statut tabagique, la pente vaut −4,6 kg et représente la différence moyenne de poids entre les fumeuses et les jamais fumeuses.
💡 Astuce mémo
Codage 0-1 : l’ordonnée donne une moyenne, la pente une différence
📖 12. Échantillonnage et intervalles
🔑 Notions clés & Définitions
Fluctuation d’échantillonnage : Variation des résultats obtenus lorsque plusieurs échantillons différents sont tirés d’une même population.
Intervalle de pari : Plus petit intervalle contenant une réalisation future avec la probabilité 1−α lorsque les paramètres de la population sont connus.
★ À maîtriser
L’échantillonnage prédit les résultats d’un échantillon à partir de la population, l’estimation déduit les caractéristiques de la population à partir de l’échantillon et le test compare des groupes ou une observation à une population théorique.
Un échantillon représentatif est obtenu par tirage au sort et ses différences avec la population reflètent le hasard, tandis qu’un échantillon biaisé n’est pas tiré au hasard et peut mal représenter la population.
La largeur d’un intervalle de pari augmente avec le niveau de confiance et diminue lorsque la taille de l’échantillon augmente.
Compléments
📐 Formule — Pour une proportion et lorsque nπ≥5, l’intervalle de pari de niveau 1−α est [π−zαnπ(1−π);π+zαnπ(1−π)].
💡 Astuce mémo
Échantillonnage → estimation → test
📖 13. Intervalles de confiance
🔑 Notions clés & Définitions
Intervalle de confiance : Intervalle construit à partir d’un échantillon qui, avec une confiance donnée, contient la vraie valeur inconnue de la population.
★ À maîtriser
📌 L’intervalle de pari, construit à partir des valeurs de la population, a une probabilité donnée de contenir la valeur observée sur un échantillon, tandis que l’intervalle de confiance, construit à partir des estimations de l’échantillon, a une probabilité donnée de contenir la vraie valeur de la population.
📐 Formule — L’estimateur sans biais de la variance est s^2=so2n−1n.
📐 Formule — Pour n < 30 et une variance inconnue, sous l’hypothèse de normalité, l’intervalle de confiance d’une moyenne est IC1−α=[m^−tn−1,αns^;m^+tn−1,αns^].
📐 Formule — Lorsque n\hat p ≥ 5 et n(1-\hat p) ≥ 5, l’intervalle de confiance d’une proportion est IC1−α=[p^−zαnp^q^;p^+zαnp^q^], avec \hat q=1-\hat p.
Compléments
📌 Pour n ≥ 30, on peut en pratique assimiler l’estimateur de variance \hat{s}^2 à la variance empirique s_o^2, car leur différence est faible.
💡 Astuce mémo
Intervalle de pari : valeur observée ; intervalle de confiance : vraie valeur
📖 14. Hypothèses et risques des tests
★ À maîtriser
📌 L’hypothèse nulle H0 représente l’absence de différence attribuable à autre chose que le hasard, tandis que l’hypothèse alternative H1 représente l’existence d’une différence ou d’un effet.
📌 L’erreur de type I consiste à rejeter H0 alors qu’elle est vraie et sa probabilité est notée α, tandis que l’erreur de type II consiste à ne pas rejeter H0 alors qu’elle est fausse et sa probabilité est notée β.
📐 Formule — La puissance statistique d’un test est 1−β=Pr(rejet de H0∣H1 vraie).
Compléments
Dans la majorité des tests, on fixe α à 0,05 et β entre 0,1 et 0,2, ce qui correspond à une puissance comprise entre 80 % et 90 %.
💡 Astuce mémo
Écart observé → hasard ou rejet de H0
📖 15. Principe et principaux tests
★ À maîtriser
🔄 Un test statistique suit quatre étapes:
Poser H0 et choisir le risque α
Recueillir les données et calculer la statistique de test
Déterminer la loi sous H0 et la limite de rejet
Comparer la statistique à la limite et décider
📐 Formule — Pour comparer une proportion observée à une proportion théorique, la statistique est zo=π(1−π)/npo−π et, au seuil bilatéral de 5 %, on rejette H0 si ∣zo∣>1,96.
📐 Formule — Pour comparer deux proportions observées, la statistique est zo=poqo(n11+n21)po1−po2 avec po=n1+n2n1po1+n2po2 et q_o=1-p_o.
📌 Pour des données appariées, on calcule la moyenne des différences entre les deux mesures chez chaque sujet, tandis que pour des groupes indépendants on compare directement les deux moyennes.
📐 Formule — Le test du χ² d’ajustement compare une répartition observée à une répartition théorique avec ∑i=1kCi(Oi−Ci)2∼χk−12, sous la condition que tous les effectifs calculés C_i soient au moins égaux à 5.
Compléments
📐 Formule — Pour comparer deux moyennes indépendantes avec au moins un petit échantillon, la statistique suit une loi de Student à n_1+n_2-2 degrés de liberté et utilise la variance poolée so2=n1+n2−2(n1−1)so12+(n2−1)so22.
💡 Astuce mémo
H0 → données → limite de rejet → décision
📖 16. Données de survie censurées
🔑 Notions clés & Définitions
Variable de survie : Mesure le temps avant la survenue d’un événement, qui peut être un décès, une négativation virale ou la fin d’une infection.
Censure : Survient lorsque, au moment de l’analyse, l’événement étudié ne s’est pas encore produit ou que le patient est perdu de vue.
📝 Points essentiels
Pour caractériser une durée de survie, il faut la durée T et l’indicateur de censure C, qui vaut typiquement 1 si le patient a eu l’événement et 0 sinon.
📐 Formule — La fonction de survie est S(t)=Pr(T>t)=1−F(t), où F(t) est la fonction de répartition de T.
💡 Astuce mémo
Une ligne du suivi s’arrête avant l’événement : c’est la censure
📖 17. Analyse des courbes de survie
🔑 Notions clés & Définitions
Fonction de survie : La probabilité qu’un patient vive plus longtemps qu’une durée t, soit S(t)=Pr(T>t)=1−F(t).
Médiane de survie : Le temps correspondant au 50e quantile, déterminé sur la courbe par S(t)=0,5 ; dans l’exemple, elle est atteinte à 56 jours.
📝 Points essentiels
La fonction de survie vérifie S(0)=1, tend vers 0 lorsque t tend vers l’infini et est décroissante au cours du temps.
📌 À 30 jours, un taux de survie de 75 % s’écrit S(30)=0,75, tandis que le taux de décès avant 90 jours vaut 1−S(90)=0,78 lorsque S(90)=0,22.
L’estimateur de Kaplan-Meier se construit période par période en calculant le risque de décès pk parmi les sujets vivants au début de chaque période, puis en appliquant S(tk)=(1−pk)S(tk−1) avec S(t0)=1.
💡 Astuce mémo
Temps observé → survie → quantiles → Kaplan-Meier
📖 18. Essais cliniques et causalité
🔑 Notions clés & Définitions
Essai clinique : Une recherche biomédicale organisée et pratiquée chez l’être humain pour développer des connaissances biologiques ou médicales et évaluer une intervention.
Erreur résiduelle : L’écart entre la valeur observée et sa prédiction par la droite de régression, soit ϵi=yi−axi−b.
Écart réduit : La probabilité 2(1−F(x)) que la variable soit supérieure ou égale à x en valeur absolue.
Loi du Chi-deux : Somme des carrés de n variables aléatoires indépendantes suivant une loi normale centrée réduite.
Table de Student : Donne, pour chaque degré de liberté et chaque valeur x, la probabilité qu’une variable de Student dépasse x en valeur absolue.
Loi binomiale : Décrit le nombre de succès obtenus lors de n tirages indépendants ayant chacun une probabilité p de succès.
📝 Points essentiels
📌 Une étude observationnelle mesure des phénomènes sans intervention, tandis qu’une étude expérimentale impose une contrainte aux sujets, comme recevoir un médicament.
Un essai randomisé attribue les traitements par tirage au sort après consentement éclairé, afin de rendre les groupes similaires pour les facteurs de confusion connus et inconnus.
📌 Le degré de signification mesure la compatibilité d’une différence avec le hasard, tandis que l’amplitude du lien se quantifie par des mesures comme le RR, l’OR ou la pente d’une régression.
📐 Formule — La régression linéaire univariée s’écrit Y=aX+b+ϵ, et la prédiction pour un sujet i est y^i=axi+b.
📐 Formule — Les estimations des paramètres de la droite vérifient a^=Var(X)cov(X,Y) et b^=yˉ−a^xˉ.
📐 Formule — Le coefficient de détermination est R2=1−∑i=1n(yi−yˉ)2∑i=1n(yi−y^i)2 et mesure la part de variabilité de Y expliquée par le modèle.
📐 Formule — La régression linéaire multivariée s’écrit Y=∑k=1KakXk+b+ϵ, où chaque coefficient ak mesure l’effet propre de Xk lorsque les autres variables restent constantes.
Pour x=1,96 dans la loi normale centrée réduite, F(x)=0,9750 et l’écart réduit vaut 0,05, soit 5 %.
📌 L’espérance E(X) est la moyenne théorique d’une variable aléatoire, tandis que moy(x) est la moyenne des observations d’un échantillon.
📌 La variance Var(X) décrit la dispersion théorique d’une variable aléatoire, tandis que s² désigne la variance des observations.
💡 Astuce mémo
Tirage au sort → facteurs équilibrés → interprétation causale
📊 Tableaux de synthèse
Types de variables
Type
Sous-type
Caractéristique
Quantitative
Discrète ou continue
Valeur numérique
Qualitative
Nominale
Catégories sans ordre
Qualitative
Ordinale
Catégories avec ordre naturel
Censurée
Durée et statut
Temps avant un événement partiellement observé
Mesures d’association
Mesure
Interprétation
Valeur nulle
Risque relatif
Rapport de deux risques
RR=1
Odds ratio
Rapport de deux cotes
OR=1
Teste tes connaissances
Teste tes connaissances sur Fondements de biostatistique avec 11 questions à choix multiples et corrections détaillées.
1. Quel domaine la biostatistique applique-t-elle principalement aux sciences du vivant, à la biologie et à la médecine ?