La biostatistique permet de passer de l’observation réalisée sur un échantillon à une généralisation concernant une population plus large.
La biostatistique permet notamment d’évaluer une valeur biologique normale, l’intérêt d’un examen complémentaire, le risque d’une complication et l’efficacité comparative de traitements.
Observation d’un échantillon → généralisation à la population → progrès des connaissances médicales
★ À maîtriser
Un échantillon est représentatif de sa population lorsqu’il a été obtenu par tirage au sort, condition nécessaire et suffisante selon le cours ; un échantillon non représentatif est biaisé.
La variabilité totale est la résultante de la variabilité biologique et de la variabilité métrologique, cette dernière correspondant à l’erreur due aux appareils de mesure.
La variabilité biologique résulte de la variabilité intra-individuelle, observée lors de mesures répétées chez un même individu, et de la variabilité inter-individuelle, observée entre différents individus.
Compléments
Biologique = variation du vivant ; métrologique = erreur de mesure
★ À maîtriser
Transformer une variable quantitative continue en classes qualitatives entraîne une perte d’information, tandis que coder numériquement une variable qualitative ne la rend pas automatiquement quantitative.
Une variable quantitative prend des valeurs numériques et peut être discrète, comme le nombre d’enfants, ou continue, comme le poids mesuré avec une précision suffisante.
Une variable qualitative nominale possède des modalités sans ordre naturel, comme la couleur des yeux, tandis qu’une variable qualitative ordinale possède des modalités ordonnées, comme un niveau faible, moyen ou fort.
Compléments
📌 Les modalités d’une variable qualitative doivent être disjointes et couvrir l’ensemble des valeurs possibles.
Quantitative = nombre ; qualitative = catégorie ; censurée = durée jusqu’à l’événement
📐 Formule — Pour une classe k, la fréquence vérifie , avec .
📐 Formule — La moyenne empirique de n observations vérifie .
📐 Formule — La variance empirique vérifie et mesure la dispersion des valeurs autour de la moyenne.
Diagramme en bâtons : hauteur ; histogramme : aire
📐 Formule — Pour deux événements A et B, .
📐 Formule — La probabilité conditionnelle vérifie .
📐 Formule — Deux événements A et B sont indépendants si , ce qui signifie que la réalisation de l’un n’a pas d’effet sur l’autre.
📌 Un phénomène déterministe donne le même résultat lorsqu’on répète l’expérience, tandis qu’un phénomène aléatoire produit des résultats variables dont la répartition est prévisible.
Déterministe = résultat prévisible ; aléatoire = résultats variables mais répartition prévisible
★ À maîtriser
📐 Formule — Pour deux événements A et B, , et s’ils sont exclusifs, .
📐 Formule — La probabilité conditionnelle vérifie lorsque .
📐 Formule — Le théorème de Bayes donne .
📐 Formule — Deux événements A et B sont indépendants si , ce qui implique et .
Compléments
📐 Formule — La valeur prédictive positive et la valeur prédictive négative vérifient respectivement et .
Conditionner restreint l’univers ; Bayes inverse le conditionnement
📐 Formule — Une loi discrète est une loi de probabilité si chaque probabilité est comprise entre 0 et 1 et si .
📐 Formule — Pour une variable discrète, la fonction de répartition est .
📐 Formule — Pour une variable discrète, et .
📐 Formule — Si X suit une loi binomiale de paramètres n et p, avec q=1-p, alors pour .
📐 Formule — Pour une loi binomiale , l’espérance vaut et la variance vaut .
Bernoulli : un succès ; binomiale : plusieurs essais
★ À maîtriser
📐 Formule — Pour une variable continue de densité f, .
📐 Formule — Une fonction f est une densité de probabilité si partout et si .
Compléments
📐 Formule — Pour une variable continue, et .
📐 Formule — La densité de la loi normale est .
La loi normale forme une cloche symétrique autour de sa moyenne
★ À maîtriser
📐 Formule — Pour deux variables aléatoires X et Y, et .
📐 Formule — Si X et Y sont indépendantes, alors .
📐 Formule — Si X1,…,Xn sont indépendantes, de même moyenne m et de variance s², alors leur moyenne suit approximativement, pour n suffisamment grand, .
📐 Formule — Dans un tableau de contingence, le risque relatif compare le risque d’un événement chez les exposés et les non-exposés : .
Compléments
En pratique, le théorème central limite est souvent considéré comme applicable lorsque .
Dans l’exemple étudié, le risque de cancer est de 50 % chez les fumeurs et de 5 % chez les non-fumeurs, soit un risque relatif de 10 dans cet échantillon.
Indépendance → covariance nulle → variance additive
★ À maîtriser
📐 Formule — Le risque relatif du cancer chez les fumeurs par rapport aux non-fumeurs est .
📐 Formule — L’odds ratio est le rapport des cotes et se calcule par .
📌 Un RR ou un OR égal à 1 indique l’absence d’association mesurée, une valeur supérieure à 1 indique un facteur aggravant et une valeur inférieure à 1 indique un facteur protecteur.
📌 Quand RR est supérieur à 1, OR est supérieur à RR, et quand RR est inférieur à 1, OR est inférieur à RR.
Dans le tableau tabagisme-cancer, la proportion de cancer est de 0,5 chez les fumeurs (50/100) et de 0,05 chez les non-fumeurs (10/200).
L’écart entre OR et RR diminue lorsque la maladie est rare ou lorsque les deux mesures sont proches de 1; si la prévalence dépasse 20 % et que OR est supérieur à 2, il faut éviter d’interpréter OR comme RR.
Compléments
Dans l’exemple tabagisme-cancer, le risque relatif du cancer chez les fumeurs par rapport aux non-fumeurs vaut 10, tandis que le risque relatif d’être fumeur chez les cancéreux par rapport aux non-cancéreux vaut 4.
Dans l’exemple tabagisme-cancer, l’odds ratio vaut 19, et l’odds ratio calculé dans l’autre sens est également égal à 19.
📌 L’OR est l’inverse de l’OR de non-maladie, alors que le RR de non-maladie n’est généralement pas l’inverse du RR de maladie.
RR compare des risques, OR compare des cotes
★ À maîtriser
📐 Formule — Dans une régression linéaire, la pente et l’ordonnée à l’origine sont estimées par et .
📐 Formule — La covariance est définie par et elle est positive lorsque X et Y ont tendance à varier dans le même sens.
📐 Formule — Le coefficient de corrélation linéaire de Pearson est et il est compris entre -1 et 1.
📌 Si la pente a est positive, Y augmente quand X augmente; si a est négative, Y diminue quand X augmente; une variation d’une unité de X entraîne une variation moyenne de a unités de Y.
📌 Une corrélation linéaire entre deux variables ne prouve pas que l’une est la cause de l’autre, car un facteur de confusion peut expliquer leur variation simultanée.
Compléments
Variation de X → variation moyenne de Y
★ À maîtriser
📐 Formule — Avec une variable qualitative binaire codée 0 et 1, le modèle est , où b est la moyenne du groupe codé 0 et a est la différence moyenne entre les groupes codés 1 et 0.
📌 Dans une relation entre deux variables quantitatives, la variable explicative ou indépendante est notée x, tandis que la variable réponse ou dépendante est notée y.
Compléments
📌 Coder directement une variable nominale à trois modalités par les valeurs 0, 1 et 2 impose une égalité des écarts entre catégories qui n’est généralement pas justifiée.
Codage 0-1 : b est le groupe 0, a est l’écart entre groupes
★ À maîtriser
📐 Formule — Pour une moyenne et lorsque n est au moins égal à 30, l’intervalle de pari est .
L’échantillonnage prédit les résultats d’un échantillon à partir d’une population, l’estimation déduit les caractéristiques de la population à partir d’un échantillon, et le test compare des groupes ou une observation à une population théorique.
Un échantillon tiré au sort est représentatif, tandis qu’un échantillon obtenu par un tirage non aléatoire est biaisé.
L’intervalle de pari à 95 % a 95 % de chance de contenir le résultat d’un futur échantillon, tandis que l’intervalle de confiance à 95 % a 95 % de chance de contenir la vraie valeur de la population.
Compléments
Intervalle de pari : population → échantillon ; intervalle de confiance : échantillon → population
★ À maîtriser
📐 Formule — Pour une variance empirique , l’estimateur sans biais de la variance est .
📐 Formule — Pour une moyenne avec , une population normale et une variance inconnue, l’intervalle de confiance est .
📌 Pour l’intervalle de confiance d’une proportion, l’approximation normale est utilisable si et , avec .
📌 L’intervalle de Pari est construit à partir des valeurs dans la population et décrit la variabilité de la valeur observée, tandis que l’intervalle de confiance est construit à partir des estimations de l’échantillon et vise à contenir la vraie valeur de la population.
Compléments
📌 Pour , on peut en pratique prendre , car pour la correction ne produit qu’environ 3 % de différence.
Intervalle de Pari : valeur observée ; intervalle de confiance : vraie valeur de population
📐 Formule — La puissance statistique est la probabilité de rejeter lorsque est vraie, et vérifie .
📌 Un test statistique compare soit une observation à une valeur théorique, soit deux observations entre elles, en tenant compte des fluctuations d’échantillonnage.
📌 L’erreur de type I consiste à rejeter alors qu’elle est vraie et correspond au risque de faux positif , tandis que l’erreur de type II consiste à ne pas rejeter alors qu’elle est fausse et correspond au risque de faux négatif .
Écart observé → comparaison aux fluctuations du hasard → décision sur H0
★ À maîtriser
📐 Formule — Pour comparer une proportion observée à une proportion théorique , la statistique est , et au seuil de 5 % on rejette si .
📐 Formule — Pour comparer une moyenne observée à une moyenne théorique, on utilise une statistique normale si et une statistique de Student à degrés de liberté si , sous condition de normalité de la variable dans ce dernier cas.
📐 Formule — Pour un test du khi deux d’ajustement, la statistique est , où est l’effectif observé et l’effectif calculé sous .
📌 Pour deux moyennes appariées, on analyse la moyenne des différences calculées sujet par sujet, tandis que pour deux groupes indépendants on compare directement les deux moyennes observées.
Compléments
📐 Formule — Pour comparer deux proportions observées, la statistique est , avec et .
📐 Formule — Pour le test du khi deux d’indépendance, les effectifs attendus sont et la statistique suit sous une loi .
Proportion, moyenne, deux groupes, appariement, répartition
★ À maîtriser
📐 Formule — La fonction de survie est , où est la fonction de répartition de .
Compléments
📌 La fonction de survie vérifie et , et elle est décroissante lorsque le temps augmente.
Une ligne de suivi s’arrête avant l’événement : la durée est censurée
📐 Formule — La fonction de survie vérifie , où F(t) est la fonction de répartition de T.
📐 Formule — La régression linéaire s’écrit et la prédiction pour un sujet i est .
📐 Formule — L’erreur résiduelle d’un sujet i est et elle suit une loi normale de moyenne 0 et de variance σ².
📐 Formule — Les estimateurs des paramètres de la droite sont et , et la droite passe par le point (mx,my).
📐 Formule — Le coefficient de détermination est et représente la part de variabilité expliquée par le modèle.
📐 Formule — La régression linéaire multivariée s’écrit ; chaque coefficient ak mesure l’effet propre de Xk sur Y toutes choses égales par ailleurs.
📌 Le tirage au sort répartit les facteurs de confusion connus et inconnus entre les groupes, de sorte que la différence observée puisse être attribuée au traitement si elle est statistiquement significative.
L’estimateur de Kaplan-Meier se construit période par période en calculant le risque de décès pk parmi les sujets vivants au début de chaque période, puis en actualisant la survie par avec S(t0)=1.
La fonction de survie S(t) est décroissante, avec S(0)=1 et S(∞)=0.
📌 Sur une courbe de survie en marches d’escalier, chaque marche correspond à un événement tandis qu’un trait de censure ne modifie pas immédiatement la courbe.
📌 Une association statistique ne suffit pas à établir une causalité, car un facteur de confusion peut être associé à la fois à l’exposition et au résultat.
Temps observé → survie → quantiles → médiane
| Type | Caractéristique | Exemple |
|---|---|---|
| Quantitative | Valeurs numériques discrètes ou continues | Nombre d’enfants, poids |
| Qualitative nominale | Catégories sans ordre | Couleur des yeux |
| Qualitative ordinale | Catégories avec ordre naturel | Niveau faible, moyen ou fort |
| Censurée | Durée avant un événement partiellement observée | Temps avant le décès |
| Indicateur | Expression | Population de référence |
|---|---|---|
| Sensibilité | Pr(T+|M+) | Malades |
| Spécificité | Pr(T-|M-) | Non-malades |
| VPP | Pr(M+|T+) | Tests positifs |
| VPN | Pr(M-|T-) | Tests négatifs |
Teste tes connaissances sur Associations et estimation statistique avec 69 questions à choix multiples et corrections détaillées.
1. Quel domaine correspond à la biostatistique ?
2. Laquelle de ces utilisations relève notamment de la biostatistique en médecine ?
Mémorisez les concepts clés de Associations et estimation statistique avec 87 flashcards interactives.
Qu'est-ce que la biostatistique ?
La statistique appliquée aux sciences du vivant, à la biologie et à la médecine.
Que permet d'évaluer la biostatistique ?
Une valeur biologique normale, l’intérêt d’un examen, le risque d’une complication et l’efficacité comparative de traitements.
Quel est le rôle principal de la biostatistique dans l'observation ?
Passer de l’observation sur un échantillon à une généralisation sur une population plus large.
Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.
Générateur de fiches