La statistique descriptive décrit les valeurs des variables, tandis que la statistique inférentielle généralise les résultats d’un échantillon à une population et évalue l’impact d’une intervention au-delà de la variabilité biologique et métrologique.
La variabilité totale résulte de la variabilité biologique et de la variabilité métrologique, cette dernière étant due aux appareils de mesure et appelée aussi erreur de mesure.
La variabilité biologique résulte de la variabilité intra-individuelle, observée chez un même individu, et de la variabilité inter-individuelle, observée entre différents individus.
Variabilité biologique et métrologique → incertitude → besoin de la biostatistique
★ À maîtriser
📌 Un échantillon est représentatif de sa population s’il a été obtenu par tirage au sort, condition nécessaire et suffisante selon le cours.
📌 Les variables quantitatives sont des nombres, éventuellement associés à une unité, tandis que les variables qualitatives indiquent l’appartenance à une classe ou catégorie.
Compléments
📌 Les variables qualitatives nominales n’ont pas d’ordre entre leurs modalités, tandis que les variables qualitatives ordinales possèdent un ordre naturel entre leurs classes.
Population = généraliser ; échantillon = observer
📐 Formule — Pour une variable quantitative regroupée en K classes, la fréquence de la classe k vérifie , où n_k est son effectif et n = n_1 + ... + n_K l’effectif total.
📌 Dans un histogramme, la fréquence d’une classe est représentée par l’aire du rectangle, tandis que dans un diagramme en bâtons elle est représentée par la hauteur de la barre.
📐 Formule — La moyenne empirique de n observations est .
📐 Formule — La variance empirique vérifie et mesure la dispersion autour de la moyenne.
Histogramme : aire ; diagramme en bâtons : hauteur
📌 Un phénomène déterministe donne le même résultat lorsqu’on répète l’expérience, tandis qu’un phénomène aléatoire produit des résultats variables dont la répartition est prévisible.
📐 Formule — Pour deux événements A et B, .
📐 Formule — La probabilité conditionnelle de A sachant B vérifie .
📐 Formule — Le théorème de Bayes donne .
Épreuve → événement → probabilité
★ À maîtriser
📐 Formule — La probabilité d’une union vérifie .
📐 Formule — La probabilité conditionnelle vérifie lorsque .
📐 Formule — Le théorème de Bayes vérifie .
📐 Formule — Si A et B sont indépendants, alors et .
Compléments
📐 Formule — Le théorème de la probabilité totale donne pour une partition complète d’événements de probabilités non nulles.
Intersection → conditionnement → Bayes
★ À maîtriser
📌 La sensibilité est , tandis que la spécificité est .
📐 Formule — La proportion de faux négatifs vaut et la proportion de faux positifs vaut .
📐 Formule — Avec la prévalence pe, la sensibilité Se et la spécificité Sp, et .
Compléments
📌 Pour estimer sans biais la sensibilité et la spécificité, il faut des échantillons représentatifs des malades et des non-malades, tandis que la VPP et la VPN exigent un échantillon représentatif de toute la population.
Sensibilité chez les malades, spécificité chez les non-malades
★ À maîtriser
📌 Une fonction discrète est une fonction de probabilité si chaque probabilité est comprise entre 0 et 1 et si .
📐 Formule — Pour une variable discrète, et .
📐 Formule — Si X compte les succès de n réalisations indépendantes de probabilité p, alors X suit une loi binomiale B(n,p) et .
Compléments
📐 Formule — Si , alors et .
Succès indépendants → loi binomiale
★ À maîtriser
📐 Formule — Une densité f vérifie , avec et une intégrale totale égale à 1.
📐 Formule — Pour une variable continue, et .
📐 Formule — Une variable normale X suit et possède une densité en cloche symétrique de moyenne et de médiane m, avec variance s².
📐 Formule — Si , alors la variable centrée réduite suit .
📐 Formule — Le théorème central limite indique que, pour n variables indépendantes de même moyenne m et variance s², leur moyenne suit approximativement lorsque n est suffisamment grand, souvent n≥30.
Compléments
📐 Formule — L’erreur standard de la moyenne vaut et diminue quand l’effectif n augmente.
Une cloche normale autour d’une moyenne, resserrée quand n augmente
★ À maîtriser
📐 Formule — Le risque relatif du cancer chez les fumeurs par rapport aux non-fumeurs est , estimé par .
📐 Formule — L’odds ratio est le rapport des cotes et vérifie .
📌 Pour le risque relatif comme pour l’odds ratio, une valeur égale à 1 indique l’absence d’association mesurée, une valeur supérieure à 1 indique un facteur aggravant et une valeur inférieure à 1 indique un facteur protecteur.
Compléments
RR compare les risques ; OR compare les cotes.
★ À maîtriser
📐 Formule — Dans une régression linéaire, les coefficients estimés vérifient et .
📌 Si la pente a est positive, Y augmente quand X augmente ; si a est négative, Y diminue quand X augmente ; une variation d’une unité de X entraîne une variation moyenne de a unités de Y.
📐 Formule — Le coefficient de corrélation linéaire de Pearson est et est compris entre -1 et 1.
📌 Une corrélation entre deux variables n’établit pas que l’une est la cause de l’autre, car un facteur de confusion peut expliquer leur variation simultanée.
Compléments
Variation de X → variation moyenne de Y.
★ À maîtriser
📐 Formule — Lorsque x est codée 0 pour une modalité et 1 pour l’autre, dans , le coefficient a vaut , c’est-à-dire la différence entre les deux moyennes de y.
📌 Avec une variable qualitative à trois modalités, on choisit généralement une catégorie de référence et on calcule un coefficient séparé pour chaque autre modalité.
📌 Coder arbitrairement une variable nominale à trois modalités par 0, 1 et 2 impose une égalité des écarts entre catégories qui n’est généralement pas justifiée.
Compléments
Pour étudier une variable quantitative y selon une variable qualitative x, on décrit d’abord y pour chaque modalité de x, puis on compare les moyennes ou on ajuste une régression.
Dans l’exemple du poids selon le tabagisme, la pente est de −4,6 kg : le poids moyen des nouveau-nés de mères fumeuses diffère de 4,6 kg de celui des mères jamais fumeuses selon le codage utilisé.
Codage 0–1 : la pente devient une différence de moyennes.
★ À maîtriser
L’échantillonnage prédit les résultats d’un futur échantillon à partir de la population, l’estimation déduit les caractéristiques de la population à partir d’un échantillon, et le test compare des groupes ou une théorie à des observations.
Un échantillon représentatif est obtenu par tirage au sort, tandis qu’un échantillon biaisé résulte d’un recrutement qui ne donne pas à la population une représentation adéquate.
La largeur d’un intervalle de pari diminue lorsque la taille n de l’échantillon augmente et augmente lorsque le niveau de confiance augmente.
Compléments
📐 Formule — Pour une proportion, lorsque , l’intervalle de pari approché de niveau 1−α est .
Intervalle de pari : futur échantillon ; intervalle de confiance : vraie population.
★ À maîtriser
📌 L’intervalle de pari est construit à partir des valeurs dans la population, tandis que l’intervalle de confiance est construit à partir des estimations obtenues dans l’échantillon.
📐 Formule — L’estimateur sans biais de la variance est .
Compléments
📌 La loi suivie par les observations individuelles d’un échantillon décrit la distribution de la caractéristique d’intérêt, tandis que la loi suivie par les moyennes de plusieurs échantillons décrit la distribution de la moyenne de cette caractéristique.
Intervalle de pari : valeurs de population ; intervalle de confiance : estimations d’échantillon
★ À maîtriser
📐 Formule — Pour n < 30 et une variable normalement distribuée, avec σ inconnu, l’intervalle de confiance d’une moyenne est .
📐 Formule — Pour une proportion, lorsque n p_o ≥ 5 et n(1 − p_o) ≥ 5, l’intervalle de confiance approché est avec \hat q=1−\hat p.
Compléments
Grand échantillon → normale ; petit échantillon → Student
📌 L’erreur de type I consiste à rejeter H0 alors qu’elle est vraie, tandis que l’erreur de type II consiste à ne pas rejeter H0 alors qu’elle est fausse.
La puissance statistique d’un test est et correspond à la probabilité de rejeter H0 lorsque H1 est vraie.
🔄 Un test statistique suit les étapes suivantes:
Fluctuations d’échantillonnage → décision avec risques d’erreur
📐 Formule — Pour comparer une proportion observée p_o à une proportion théorique π, la statistique est et suit approximativement une loi normale centrée réduite si nπ ≥ 5 et n(1−π) ≥ 5.
📐 Formule — Pour comparer deux proportions observées, la statistique est avec et q_o=1−p_o.
📌 Pour des données appariées, on calcule pour chaque sujet la différence entre les deux mesures puis on teste la moyenne de ces différences, tandis que pour des groupes indépendants on compare directement leurs moyennes.
📐 Formule — Dans le test du Chi2 d’ajustement, la statistique est et suit sous H0 une loi du χ² à k−1 degrés de liberté.
📐 Formule — La fonction de survie est , avec S(0)=1 et S(∞)=0.
Données indépendantes ≠ données appariées ; données complètes ≠ données censurées
★ À maîtriser
📌 Sur une courbe de survie, chaque marche correspond à un événement tandis qu’une censure ne modifie pas la courbe mais réduit le nombre de patients à risque pour les temps suivants.
Compléments
📌 Pour comparer deux courbes de survie, on peut comparer graphiquement leurs médianes ou leurs taux de survie à un temps donné ; le test du Log-rank teste l’égalité des risques d’événement entre les groupes pour tout t.
Temps observé → survie S(t) → quantiles → comparaison
📌 Le degré de signification mesure la compatibilité d’une différence avec le hasard, tandis que l’amplitude de l’effet se mesure par des grandeurs comme le RR, l’OR ou la pente de régression.
📐 Formule — La régression linéaire univariée s’écrit , où ε est l’erreur résiduelle et où la prédiction pour un sujet i est .
📐 Formule — Le coefficient de détermination est et mesure la part de variabilité de Y expliquée par X.
📌 Dans une régression multivariée, a_k=0 indique l’absence de relation linéaire, a_k>0 indique qu’une augmentation d’une unité de X_k augmente en moyenne Y de a_k, et a_k<0 indique qu’elle le diminue de a_k, toutes les autres variables restant constantes.
La régression linéaire nécessite:
La table de la loi normale centrée réduite donne la densité f(x), la fonction de répartition F(x)=Pr(X<x) et l’écart réduit .
Pour un degré de liberté égal à 1 et une probabilité de 0,05, la table du Chi-deux donne une valeur critique de 3,841, qui est approximativement le carré de 1,96.
Tirage au sort → groupes comparables → causalité
| Type | Origine | Comparaison |
|---|---|---|
| Biologique | Caractéristique du vivant | Intra-individuelle et inter-individuelle |
| Métrologique | Appareils de mesure | Aussi appelée erreur de mesure |
| Totale | Biologique et métrologique | Résultante des deux |
| Indicateur | Expression | Population de référence |
|---|---|---|
| Sensibilité | Pr(T+ | M+) | Malades |
| Spécificité | Pr(T- | M-) | Non-malades |
| VPP | Pr(M+ | T+) | Tests positifs |
| VPN | Pr(M- | T-) | Tests négatifs |
Teste tes connaissances sur Survie, essais cliniques et régression avec 66 questions à choix multiples et corrections détaillées.
1. Quel est le domaine d’application de la biostatistique ?
2. Quelle distinction caractérise la statistique descriptive et la statistique inférentielle ?
Mémorisez les concepts clés de Survie, essais cliniques et régression avec 88 flashcards interactives.
Qu'est-ce que la biostatistique ?
La statistique appliquée aux sciences du vivant, biologie et médecine.
Quelle différence entre statistique descriptive et inférentielle ?
La descriptive décrit les variables, l'inférentielle généralise à la population et évalue l'impact d'une intervention.
De quoi résulte la variabilité totale ?
De la variabilité biologique et de la variabilité métrologique.
Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.
Générateur de fiches