Fiche de révision : Statistique descriptive et épidémiologie

Plan du Cours

  1. Population et échantillonnage
  2. Types de variables statistiques
  3. Représentation des données
  4. Description des variables quantitatives
  5. Intervalles de confiance
  6. Fondements de l’épidémiologie
  7. Types d’études épidémiologiques
  8. Risques et tests statistiques
  9. Interprétation de la valeur p
  10. Choix des tests statistiques
  11. Comparaison de pourcentages
  12. Comparaison de moyennes
  13. Analyse de variance
  14. Tests non paramétriques
  15. Nombre de sujets nécessaires
  16. Conséquences du dimensionnement

1. Population et échantillonnage

Notions clés & Définitions

  • Biostatistique : D. Schwartz — Méthode de raisonnement permettant d’interpréter des données caractérisées par leur variabilité, notamment dans les sciences de la vie et de la santé, et constituant une science de l’incertain pour prendre des décisions sous incertitude.
  • Population statistique : Ensemble très grand, voire infini, dont l’étude exhaustive est impossible.
  • Échantillon statistique : Partie de la population constituée de sujets ou d’unités statistiques sélectionnés pour être étudiés.

Points essentiels

📌 En sciences de la vie et de la santé, un échantillon représentatif doit être sélectionné par une méthode aléatoire et comporter un nombre de sujets suffisant.

Astuce mémo

Population = ensemble étudié en théorie ; échantillon = partie effectivement étudiée

2. Types de variables statistiques

Notions clés & Définitions

  • Variable statistique : Variable aléatoire mesurée chez les individus d’un échantillon et susceptible de prendre des valeurs différentes selon les individus.

★ À maîtriser

  • Une variable quantitative s’exprime par un nombre, tandis qu’une variable qualitative prend des modalités non quantifiables.

  • Une variable quantitative continue peut théoriquement prendre toute valeur d’un intervalle, tandis qu’une variable quantitative discrète ne prend que certaines valeurs, souvent entières.

  • Une variable qualitative ordinale possède un ordre entre ses modalités, tandis qu’une variable qualitative nominale possède des modalités non ordonnées.

Compléments

  • Les modalités d’une variable qualitative doivent être exhaustives et mutuellement exclusives.

Astuce mémo

Quantitatif = nombre ; qualitatif = modalité

3. Représentation des données

★ À maîtriser

📌 Pour une variable quantitative, on utilise notamment l’histogramme, dont les barres verticales sont contiguës, ou le polygone de fréquences.

📌 Pour une variable qualitative, on utilise un diagramme en barres dont les barres verticales sont séparées par un espace.

Compléments

📌 Un tableau ou un graphique doit être compréhensible indépendamment du texte, comporter un titre adapté et présenter des axes, des échelles et des unités correctement indiqués.

Astuce mémo

Histogramme contigu pour le quantitatif ; barres séparées pour le qualitatif

4. Description des variables quantitatives

Notions clés & Définitions

  • Moyenne arithmétique : La moyenne arithmétique d’un échantillon est m=∑i=1nxinm=\frac{\sum_{i=1}^{n}x_i}{n}, ou m=∑nixinm=\frac{\sum n_i x_i}{n} lorsque chaque valeur est associée à un effectif.
  • Médiane : La médiane est la valeur centrale d’une distribution ordonnée qui la divise en deux parties égales ; pour un effectif pair, elle est la moyenne des deux valeurs centrales.
  • Mode : Le mode est la valeur la plus fréquemment observée dans une série de données.

★ À maîtriser

📐 Formule — La variance d’un échantillon est s2=∑(xi−m)2n−1s^2=\frac{\sum(x_i-m)^2}{n-1} et s’exprime dans le carré de l’unité de la variable.

📐 Formule — L’écart-type est la racine carrée de la variance et, pour un échantillon, vaut s=∑(xi−m)2n−1s=\sqrt{\frac{\sum(x_i-m)^2}{n-1}}.

Compléments

📐 Formule — L’erreur standard d’un échantillon est SE=sn−1SE=\frac{s}{\sqrt{n-1}}.

Astuce mémo

Position → dispersion : moyenne, médiane, mode puis variance et écart-type

5. Intervalles de confiance

Notions clés & Définitions

  • Intervalle de confiance : Fourchette de valeurs dans laquelle le paramètre inconnu de la population a habituellement une probabilité de 95 % de se trouver, pour un risque α habituellement fixé à 5 %.

★ À maîtriser

📐 Formule — L’intervalle de confiance approché d’une proportion est p±εαp(1−p)np\pm\varepsilon_\alpha\sqrt{\frac{p(1-p)}{n}}, avec εα=1,96\varepsilon_\alpha=1{,}96 lorsque α vaut 5 %.

📌 Pour l’intervalle de confiance approché d’une proportion, les quatre quantités n pinf, n(1−pinf), n psup et n(1−psup) doivent toutes être supérieures ou égales à 5.

📐 Formule — L’intervalle de confiance approché d’une moyenne est m±εαsnm\pm\varepsilon_\alpha\frac{s}{\sqrt n} et sa condition de validité usuelle est n≥30n\ge 30.

Compléments

📌 La largeur d’un intervalle de confiance diminue lorsque l’effectif augmente, lorsque le risque alpha augmente ou lorsque la variabilité du paramètre diminue.

Astuce mémo

Effectif plus grand → intervalle plus étroit → estimation plus précise

6. Fondements de l’épidémiologie

Notions clés & Définitions

  • Épidémiologie : OMS — Étude de la distribution des maladies dans les populations humaines ainsi que des influences qui déterminent cette distribution.

★ À maîtriser

  • 🔄 La démarche épidémiologique comprend les étapes suivantes:
    1. Détermination d’un problème de santé
    2. Formulation d’une hypothèse
    3. Mise en place d’un protocole d’enquête
    4. Réalisation de l’enquête
    5. Analyse des résultats
    6. Communication des résultats
    7. Mise en place de mesures

📌 L’épidémiologie descriptive étudie la répartition des maladies, l’épidémiologie analytique étudie leurs causes et facteurs de risque, et l’épidémiologie évaluative mesure l’impact des programmes de santé.

Compléments

  • En 1747, James Lind a comparé six produits chez 12 marins atteints de scorbut et a observé une amélioration rapide chez ceux qui consommaient des agrumes.

Astuce mémo

Problème → hypothèse → protocole → enquête → analyse → communication → mesures

7. Types d’études épidémiologiques

★ À maîtriser

📌 Une étude transversale recueille les informations à un moment donné et estime principalement la prévalence, tandis qu’une étude longitudinale suit les sujets dans le temps et estime principalement l’incidence.

📐 Formule — La prévalence est la proportion nombre de malades aˋ un instant tnombre de sujets aˋ risque aˋ l’instant t\frac{\text{nombre de malades à un instant }t}{\text{nombre de sujets à risque à l’instant }t}.

📐 Formule — L’incidence cumulée est la proportion nombre de nouveaux cas pendant une peˊriodenombre de sujets aˋ risque pendant cette peˊriode\frac{\text{nombre de nouveaux cas pendant une période}}{\text{nombre de sujets à risque pendant cette période}}.

📐 Formule — Dans une cohorte, le risque relatif est RR=IeIneRR=\frac{I_e}{I_{ne}} et mesure combien le risque de maladie est multiplié en présence d’une exposition.

📐 Formule — Dans une étude cas-témoins, l’odds-ratio est OR=adbcOR=\frac{ad}{bc} et son interprétation est identique à celle du risque relatif.

  • 🔄 Un essai thérapeutique suit les étapes suivantes:
    1. Sélection
    2. Mesure de l’état de base
    3. Randomisation en groupes
    4. Suivi
    5. Mesure de l’effet selon un critère de jugement

Compléments

📌 L’odds-ratio est un bon estimateur du risque relatif si la maladie est peu fréquente, avec une prévalence inférieure à 5 %, et si les cas et les témoins sont représentatifs.

📌 La phase IV du développement d’un médicament est observationnelle et étudie les effets à long terme dans la population, contrairement aux phases expérimentales précédentes.

Astuce mémo

Transversale = prévalence ; longitudinale = incidence

8. Risques et tests statistiques

Notions clés & Définitions

  • Hypothèse nulle : Hypothèse habituellement formulée sous forme d’une égalité, par exemple l’absence de différence entre deux moyennes, que le test cherche à rejeter ou à ne pas rejeter.
  • Puissance : Capacité d’une étude à mettre en évidence une différence et intervenant dans le calcul du nombre de sujets nécessaires.
  • Valeur de p : Probabilité d’observer par hasard une différence au moins aussi importante que celle observée et constituant la plus petite valeur du risque alpha permettant de rejeter H0.

★ À maîtriser

📌 Le risque alpha est le risque de rejeter H0 alors qu’elle est vraie, tandis que le risque bêta est le risque de ne pas rejeter H0 alors qu’elle est fausse.

  • Les étapes d’un test statistique sont la définition de H0, le choix du test et de ses conditions d’application, la fixation du risque alpha, la définition de la région critique, le calcul de la statistique, la décision et l’interprétation de la valeur de p.

📌 Une valeur de p inférieure ou égale à 0,05 conduit habituellement à rejeter H0 et à déclarer la différence significative, tandis qu’une valeur supérieure à 0,05 conduit à ne pas rejeter H0.

Compléments

📌 Les quatre cas usuels de liaison statistique sont la comparaison de pourcentages, la comparaison de deux moyennes, la comparaison de plus de deux moyennes et l’étude de la corrélation entre deux variables quantitatives.

Astuce mémo

H0 → test → alpha → région critique → calcul → décision → p

9. Interprétation de la valeur p

Notions clés & Définitions

  • Valeur de p : Probabilité d’observer par hasard une différence entre les valeurs testées et la plus petite valeur du risque alpha permettant de rejeter l’hypothèse nulle.

Points essentiels

📌 Si p ≤ 0,05, la différence est habituellement considérée comme significative et n’est pas attribuée au hasard, tandis que si p > 0,05, elle n’est pas considérée comme significative ou les effectifs peuvent être insuffisants pour la démontrer.

Astuce mémo

p ≤ 0,05 : significatif ; p > 0,05 : non significatif

10. Choix des tests statistiques

Points essentiels

  • Les quatre situations usuelles sont:
    • la liaison entre deux variables qualitatives
    • la liaison entre une variable qualitative binaire et une variable quantitative
    • la liaison entre une variable qualitative nominale à plus de deux classes et une variable quantitative
    • la liaison entre deux variables quantitatives

📌 Pour les trois premières situations, les échantillons peuvent être indépendants, avec des sujets différents, ou appariés, avec les mêmes sujets ou des sujets associés selon un critère d’appariement.

📌 Un test paramétrique suppose que les variables comparées suivent une loi de probabilité dans la population, tandis qu’un test non paramétrique ne repose pas sur une loi de probabilité et utilise les rangs des données.

Astuce mémo

Qualitatif–qualitatif, qualitatif–quantitatif, puis quantitatif–quantitatif

11. Comparaison de pourcentages

★ À maîtriser

  • Le test du chi-deux d’indépendance recherche une association entre deux variables qualitatives en comparant leur distribution entre plusieurs sous-populations.

  • Le test du chi-deux est applicable lorsque tous les effectifs théoriques Cij sont supérieurs ou égaux à 5.

  • Lorsque Cij est inférieur à 5, le test corrigé de Yates est utilisé si Cij est égal à 3 ou 4, tandis que le test exact de Fisher est utilisé si Cij est inférieur à 3.

  • Pour deux échantillons appariés, le test du chi-deux d’indépendance ne convient pas et le test du chi-deux de Mac Nemar doit être utilisé.

  • Le test du chi-deux de Mac Nemar ne tient compte que des paires discordantes et nécessite la condition f + g ≥ 10.

Compléments

📐 Formule — Dans un tableau de contingence, l’effectif théorique est calculé par Cij=tli×tcjTgC_{ij} = \frac{t_{li} \times t_{cj}}{T_g}.

  • Dans l’exemple des fractures, la valeur calculée du chi-deux est 6,42, supérieure à la valeur seuil de 3,84 au risque de 5 %, ce qui conduit à rejeter l’hypothèse d’absence d’association entre fracture ouverte et complications.

Astuce mémo

Effectifs théoriques faibles → Yates ou Fisher

12. Comparaison de moyennes

★ À maîtriser

📌 Pour deux échantillons indépendants dont les effectifs sont au moins égaux à 30, le test de l’écart réduit, également appelé test Z, permet de comparer les moyennes.

📐 Formule — Pour deux échantillons indépendants, le test de l’écart réduit vérifie ε=m1−m2s12n1+s22n2\varepsilon = \frac{m_1-m_2}{\sqrt{\frac{s_1^2}{n_1}+\frac{s_2^2}{n_2}}}.

  • Dans une formulation bilatérale au risque de 5 %, on ne rejette pas H0 si e < 1,96 et on rejette H0 si e ≥ 1,96.

  • Le test t de Student pour deux échantillons indépendants nécessite la normalité des distributions et des variances égales ou dont le rapport ne dépasse pas 3.

  • Pour deux échantillons appariés, on calcule la différence entre les deux mesures de chaque paire puis on compare la moyenne de ces différences à zéro.

Compléments

📐 Formule — Pour deux petits échantillons indépendants, la variance commune est s2=(n1−1)s12+(n2−1)s22n1+n2−2s^2 = \frac{(n_1-1)s_1^2+(n_2-1)s_2^2}{n_1+n_2-2} et le nombre de degrés de liberté vaut n1+n2−2n_1+n_2-2.

Astuce mémo

Grands échantillons : écart réduit ; petits échantillons : Student

13. Analyse de variance

Notions clés & Définitions

  • Analyse de variance : Compare globalement les moyennes de plus de deux groupes et teste l’hypothèse H0:μa=μb=μcH_0 : \mu_a = \mu_b = \mu_c contre l’hypothèse selon laquelle au moins une moyenne diffère.

★ À maîtriser

📌 L’analyse de variance suppose l’homoscédasticité, c’est-à-dire des variances égales entre les groupes, ainsi que la normalité.

📌 Si F dépasse la valeur seuil Fα lue dans la table, on rejette H0 et on conclut qu’au moins une moyenne diffère des autres, sans identifier laquelle.

Compléments

  • Dans l’analyse de variance, les degrés de liberté sont p − 1 entre les groupes, N − p pour la variance résiduelle et N − 1 au total.

Astuce mémo

Différences entre groupes → variance intergroupes supérieure à la variance résiduelle

14. Tests non paramétriques

★ À maîtriser

  • Le test U de Mann-Whitney compare deux distributions en classant toutes les observations, en attribuant un rang à chacune, en calculant les sommes des rangs des deux échantillons, puis en retenant la plus petite somme comme valeur U.

📐 Formule — Le coefficient de corrélation des rangs de Spearman est calculé par rs=1−6∑di2n(n2−1)r_s = 1 - \frac{6\sum d_i^2}{n(n^2-1)}, où di est la différence entre les rangs de xi et de yi.

📌 Les tests non paramétriques sont applicables quelles que soient les distributions et utilisent les rangs, mais ils sont moins puissants que les tests paramétriques correspondants lorsque ceux-ci sont valables.

Compléments

📌 Lorsque n1 et n2 sont inférieurs à 20, on utilise la table de Mann-Whitney et on rejette H0 si U est inférieur à la valeur seuil Ua de la table.

Astuce mémo

Valeurs originales pour le paramétrique, rangs pour le non paramétrique

15. Nombre de sujets nécessaires

★ À maîtriser

  • Le nombre de sujets nécessaires peut servir à: mettre en évidence l’efficacité d’un traitement, mettre en évidence une association, évaluer la validité d’un test diagnostique, estimer une incidence ou une prévalence

  • Les éléments indispensables sont: le risque alpha consenti, le risque beta consenti, la taille de l’effet, la variabilité du critère de jugement principal

📌 Plus la taille d’effet attendue est faible ou plus la variabilité du phénomène est importante, plus le nombre de sujets nécessaires augmente.

Compléments

  • Le risque alpha est habituellement fixé à 5 %, tandis que le risque beta est habituellement compris entre 10 % et 20 %.

  • Dans l’exemple d’un essai comparant un traitement hypocholestérolémiant à un placebo, avec α = 5 %, β = 20 %, un écart-type attendu de 600 mg/dl et une différence de 200 mg/dl, le nombre nécessaire est de 141 sujets par groupe. — Fitzmaurice G., Nutrition., 2002

Astuce mémo

Effet faible ou variabilité forte → nombre de sujets plus élevé

16. Conséquences du dimensionnement

★ À maîtriser

📌 Une étude sous-dimensionnée peut produire un résultat négatif malgré une puissance insuffisante, tandis qu’une étude correctement dimensionnée et négative apporte une réponse plus claire.

📌 Le nombre de sujets nécessaires est un minimum et doit être calculé avec le test prévu pour l’analyse principale, en corrigeant le risque alpha en cas de tests multiples.

Compléments

  • Une étude sous-dimensionnée expose des sujets à des risques sans être capable de faire avancer suffisamment les connaissances, tandis qu’une étude surdimensionnée expose trop de sujets à des traitements potentiellement indésirables.

  • En cas d’incertitude sur les hypothèses du calcul, il faut réaliser une analyse de sensibilité en faisant varier les données et retenir le nombre de sujets nécessaires maximal.

Astuce mémo

Sous-dimensionnement : puissance insuffisante ; surdimensionnement : ressources et exposition inutiles

Tableaux de synthèse

Types d’études épidémiologiques

Type d’étudeTemporalitéMesure principale
TransversaleUn moment donnéPrévalence
LongitudinaleSuivi dans le tempsIncidence cumulée
CohorteExposés et non exposés suivisRisque relatif
Cas-témoinsCas et témoins, exposition rétrospectiveOdds-ratio

Choix du test selon les variables

SituationÉchantillons indépendantsÉchantillons appariés
Deux variables qualitativesChi-deux de Pearson, Yates ou FisherChi-deux de Mac Nemar
Une qualitative binaire et une quantitativeZ ou Student ; Mann-Whitney si non paramétriqueZ ou Student apparié ; Wilcoxon
Une qualitative nominale et une quantitativeAnalyse de variance ; Kruskal-WallisANOVA à deux facteurs ; Friedman
Deux variables quantitativesCorrélation linéaire + test tSpearman

Teste tes connaissances

Teste tes connaissances sur Statistique descriptive et épidémiologie avec 53 questions à choix multiples et corrections détaillées.

1. Quelle conception décrit le mieux la biostatistique selon D. Schwartz ?

2. Dans quelle situation parle-t-on d’une population statistique ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Statistique descriptive et épidémiologie avec 75 flashcards interactives.

Qu'est-ce que la biostatistique selon D. Schwartz ?

Une méthode de raisonnement pour interpréter des données variables en sciences de la vie et santé.

Quelle est la nature d'une population statistique ?

Un ensemble très grand ou infini dont l'étude exhaustive est impossible.

Qu'est-ce qu'un échantillon statistique ?

Une partie de la population constituée de sujets sélectionnés pour étude.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches