QCM : Associations et estimation statistique — 69 questions

Questions et réponses du QCM

1. Quel domaine correspond à la biostatistique ?

La mesure des phénomènes physiques indépendamment des organismes vivants
L’étude des maladies infectieuses dans les populations humaines et animales
La statistique appliquée aux sciences du vivant, à la biologie et à la médecine
L’analyse économique des systèmes de soins et des dépenses médicales

La statistique appliquée aux sciences du vivant, à la biologie et à la médecine

Explication

La biostatistique applique les méthodes statistiques aux sciences du vivant, à la biologie et à la médecine. L’étude de la fréquence et de la répartition des problèmes de santé dans les populations relève plutôt de l’épidémiologie.

2. Laquelle de ces utilisations relève notamment de la biostatistique en médecine ?

Identifier la structure chimique d’une molécule isolée
Décrire l’anatomie d’un organe sans analyser de données
Déterminer la composition nutritionnelle d’un aliment sans comparaison
Comparer l’efficacité de plusieurs traitements

Comparer l’efficacité de plusieurs traitements

Explication

La biostatistique permet notamment d’évaluer l’efficacité comparative de traitements, ainsi que des valeurs biologiques normales et des risques de complications. L’étude anatomique ou chimique ne constitue pas en elle-même un objectif biostatistique.

3. Quelle démarche caractérise la statistique inférentielle en biostatistique ?

Classer les sujets selon des catégories définies avant toute observation
Généraliser à une population les résultats observés sur un échantillon
Décrire les données recueillies sans dépasser les individus étudiés
Remplacer les mesures observées par des valeurs obtenues avec un appareil

Généraliser à une population les résultats observés sur un échantillon

Explication

La statistique inférentielle permet de passer des observations faites sur un échantillon à une généralisation concernant une population plus large. La statistique descriptive, en revanche, se limite à décrire les données observées.

4. Comment se compose la variabilité totale d’une mesure biologique ?

De la variabilité de la population et de la variabilité de l’échantillon
De la variabilité qualitative et de la variabilité quantitative
De la variabilité intra-individuelle et de la variabilité inter-individuelle
De la variabilité biologique et de la variabilité métrologique

De la variabilité biologique et de la variabilité métrologique

Explication

La variabilité totale résulte de la variabilité biologique et de la variabilité métrologique. Cette dernière correspond à l’erreur introduite par les appareils de mesure, tandis que les variations intra- et inter-individuelles décrivent des composantes biologiques.

5. Un même patient est mesuré plusieurs fois dans des conditions comparables : quelle variabilité étudie-t-on principalement ?

La variabilité métrologique
La variabilité de la population
La variabilité intra-individuelle
La variabilité inter-individuelle

La variabilité intra-individuelle

Explication

La variabilité intra-individuelle concerne les différences observées lors de mesures répétées chez un même individu. La variabilité inter-individuelle compare, quant à elle, des individus différents.

6. Dans une étude, que désigne la population ?

La série des valeurs produites par un appareil de mesure
L’ensemble auquel on souhaite généraliser les conclusions
Le groupe de sujets effectivement sélectionnés pour les mesures
Le sous-groupe présentant une caractéristique biologique donnée

L’ensemble auquel on souhaite généraliser les conclusions

Explication

La population est l’ensemble des individus auquel on souhaite étendre les conclusions d’une expérience. L’échantillon correspond au groupe effectivement étudié et est généralement plus restreint.

7. Quelle condition rend un échantillon représentatif de sa population selon la règle étudiée ?

Il contient davantage de sujets que la population ciblée
Il est constitué à partir des participants les plus faciles à recruter
Il regroupe des sujets présentant des caractéristiques très similaires
Il est obtenu par tirage au sort

Il est obtenu par tirage au sort

Explication

Selon la règle étudiée, un échantillon est représentatif lorsqu’il est obtenu par tirage au sort, condition considérée comme nécessaire et suffisante. Un recrutement fondé sur la facilité d’accès peut au contraire introduire un biais.

8. Qu’est-ce qu’une variable aléatoire en biostatistique ?

Une catégorie définie sans possibilité de changement entre les sujets
Une valeur unique fixée avant l’observation de tous les individus
Une caractéristique d’un individu pouvant prendre plusieurs valeurs incertaines
Une erreur produite par un appareil lors de chaque mesure biologique

Une caractéristique d’un individu pouvant prendre plusieurs valeurs incertaines

Explication

Une variable aléatoire est une caractéristique pouvant prendre plusieurs valeurs incertaines chez les individus. Une valeur effectivement observée constitue ensuite une réalisation de cette variable.

9. Le nombre d’enfants d’une personne et son poids mesuré précisément illustrent respectivement quels types de variables quantitatives ?

Une variable nominale et une variable ordinale
Une variable discrète et une variable continue
Une variable ordinale et une variable nominale
Une variable continue et une variable discrète

Une variable discrète et une variable continue

Explication

Le nombre d’enfants prend des valeurs numériques dénombrables et constitue une variable discrète, tandis que le poids peut varier sur un continuum et constitue une variable continue. Les variables nominales et ordinales sont qualitatives, non quantitatives.

10. Quelle distinction oppose correctement une variable qualitative nominale à une variable qualitative ordinale ?

La variable nominale comporte des durées, tandis que la variable ordinale indique un événement
La variable nominale n’a pas d’ordre naturel, tandis que la variable ordinale en possède un
La variable nominale est toujours binaire, tandis que la variable ordinale comporte trois modalités
La variable nominale est numérique, tandis que la variable ordinale est mesurée sur un continuum

La variable nominale n’a pas d’ordre naturel, tandis que la variable ordinale en possède un

Explication

Les modalités nominales sont des catégories sans ordre naturel, alors que les modalités ordinales suivent un ordre naturel. Le nombre de modalités et leur caractère numérique ne définissent pas cette distinction.

11. Quelle situation correspond à une variable censurée ?

On mesure le temps jusqu’à un événement, mais certains sujets ne l’ont pas encore vécu à la fin du suivi
On classe les sujets selon une couleur sans hiérarchie entre les catégories
On compte le nombre d’enfants de chaque participant à une date donnée
On transforme des poids mesurés en catégories comme faible, moyen ou élevé

On mesure le temps jusqu’à un événement, mais certains sujets ne l’ont pas encore vécu à la fin du suivi

Explication

Une variable censurée concerne une durée avant événement lorsque certains sujets n’ont pas encore présenté cet événement au moment de l’analyse. Les autres situations décrivent respectivement une variable qualitative nominale, une variable quantitative discrète et une transformation en classes.

12. Dans une enquête, 18 individus sur 60 présentent une même modalité ; quelle est sa fréquence ?

42 individus
60 %
18 individus
30 %

30 %

Explication

La fréquence mesure la proportion d’individus concernés, soit 1860=0,30\frac{18}{60}=0{,}30, donc 30 %. L’effectif correspondant est 18 individus, mais il s’agit d’un nombre brut et non d’une proportion.

13. Dans un diagramme en bâtons représentant une variable qualitative, quelle caractéristique porte l’information sur l’effectif ou la fréquence ?

La hauteur de chaque barre
L’espace entre deux barres
La couleur de chaque barre
La largeur de chaque barre

La hauteur de chaque barre

Explication

La hauteur d’une barre correspond à l’effectif ou à la fréquence de la modalité. Sa largeur n’a pas d’interprétation statistique, contrairement à l’aire utilisée dans un histogramme.

14. Une classe contient 12 individus dans une population de 80 individus ; quelle est sa fréquence ?

0,150{,}15
0,680{,}68
6,676{,}67
1515

$$0{,}15$$

Explication

La formule donne fk=nkn=1280=0,15f_k=\frac{n_k}{n}=\frac{12}{80}=0{,}15. La valeur 15 correspondrait au pourcentage, soit 15 %, et non à la fréquence écrite sous forme décimale.

15. Que représente F(a)F(a) pour une variable statistique discrète ?

La somme des fréquences des valeurs inférieures ou égales à aa
La somme des effectifs des valeurs strictement supérieures à aa
La fréquence de la seule valeur exactement égale à aa
La moyenne des valeurs observées jusqu’à aa

La somme des fréquences des valeurs inférieures ou égales à $$a$$

Explication

La fonction de répartition cumule les fréquences des valeurs inférieures ou égales à aa. Elle ne donne donc pas la fréquence isolée de la valeur aa.

16. Quelle situation illustre un phénomène aléatoire plutôt qu’un phénomène déterministe ?

Le résultat reste identique lors de chaque répétition de l’expérience
Le résultat varie d’une répétition à l’autre, avec une répartition prévisible
Le résultat est inconnu parce que les conditions de l’expérience sont mal définies
Le résultat dépend d’une règle fixe sans aucune variation observée

Le résultat varie d’une répétition à l’autre, avec une répartition prévisible

Explication

Un phénomène aléatoire produit des résultats variables, tout en permettant de prévoir leur répartition. Une règle fixe donnant le même résultat relève d’un phénomène déterministe.

17. Lequel est un événement élémentaire lors du lancer d’un dé à six faces ?

Obtenir un nombre inférieur à 5
Obtenir un 4
Obtenir un nombre pair
Obtenir un nombre supérieur à 2

Obtenir un 4

Explication

Obtenir un 4 correspond à une seule issue et constitue donc un événement élémentaire. Les autres événements regroupent plusieurs issues et sont composés.

18. Deux événements ont des probabilités 0,60{,}6 et 0,50{,}5, et leur intersection a une probabilité 0,20{,}2 ; quelle est la probabilité de leur réunion ?

0,90{,}9
0,30{,}3
1,11{,}1
0,20{,}2

$$0{,}9$$

Explication

La formule d’inclusion-exclusion donne Pr⁡(A OU B)=0,6+0,5−0,2=0,9\Pr(A\ \mathrm{OU}\ B)=0{,}6+0{,}5-0{,}2=0{,}9. Additionner les deux probabilités sans retirer l’intersection compterait les cas communs deux fois.

19. Deux événements A et B ont des probabilités 0,40{,}4 et 0,50{,}5 ; quelle valeur de Pr⁡(A∩B)\Pr(A\cap B) suffit à établir leur indépendance ?

0,90{,}9
0,20{,}2
0,40{,}4
0,50{,}5

$$0{,}2$$

Explication

L’indépendance exige Pr⁡(A∩B)=Pr⁡(A)Pr⁡(B)=0,4×0,5=0,2\Pr(A\cap B)=\Pr(A)\Pr(B)=0{,}4\times0{,}5=0{,}2. Une intersection égale à la probabilité d’un seul événement ne constitue pas le critère d’indépendance.

20. Si Pr⁡(A∩B)=0,18\Pr(A\cap B)=0{,}18 et Pr⁡(B)=0,30\Pr(B)=0{,}30, quelle est la valeur de Pr⁡(A∣B)\Pr(A\mid B) ?

1,671{,}67
0,480{,}48
0,120{,}12
0,60{,}6

$$0{,}6$$

Explication

En se plaçant parmi les cas où BB se réalise, on obtient Pr⁡(A∣B)=0,180,30=0,6\Pr(A\mid B)=\frac{0{,}18}{0{,}30}=0{,}6. Diviser par Pr⁡(A)\Pr(A) changerait l’événement de référence et ne correspondrait pas à cette probabilité conditionnelle.

21. Quelle expression applique correctement le théorème de Bayes pour calculer Pr⁡(A∣B)\Pr(A\mid B) ?

Pr⁡(A)+Pr⁡(B∣A)−Pr⁡(B)\Pr(A) + \Pr(B\mid A) - \Pr(B)
Pr⁡(B∣A)Pr⁡(A)Pr⁡(B)\frac{\Pr(B\mid A)\Pr(A)}{\Pr(B)}
Pr⁡(A∣B)Pr⁡(B)Pr⁡(A)\frac{\Pr(A\mid B)\Pr(B)}{\Pr(A)}
Pr⁡(A)Pr⁡(B)Pr⁡(A∩B)\frac{\Pr(A)\Pr(B)}{\Pr(A\cap B)}

$$\frac{\Pr(B\mid A)\Pr(A)}{\Pr(B)}$$

Explication

Le théorème de Bayes relie la probabilité recherchée à la vraisemblance, à la probabilité a priori et à la probabilité marginale de BB : Pr⁡(A∣B)=Pr⁡(B∣A)Pr⁡(A)Pr⁡(B)\Pr(A\mid B)=\frac{\Pr(B\mid A)\Pr(A)}{\Pr(B)}. L’expression avec Pr⁡(A∣B)\Pr(A\mid B) au numérateur ne permet pas de calculer cette quantité à partir des données inversées.

22. Dans le cadre d’un test médical, quelle probabilité définit la sensibilité ?

La probabilité d’une maladie chez les personnes testées positives
La probabilité d’un test négatif chez les personnes malades
La probabilité d’un test positif chez les personnes non-malades
La probabilité d’un test positif chez les personnes malades

La probabilité d’un test positif chez les personnes malades

Explication

La sensibilité est Pr⁡(T+∣M+)\Pr(T+\mid M+) : elle mesure la capacité du test à donner un résultat positif chez les malades. La probabilité d’être malade parmi les personnes positives relève plutôt de la valeur prédictive positive.

23. Laquelle décrit correctement une variable aléatoire discrète ?

Elle associe une même probabilité à chaque valeur de son domaine.
Elle prend des valeurs dans un ensemble dénombrable auxquelles sont associées des probabilités.
Elle ne peut prendre que deux valeurs, codées 0 et 1.
Elle prend toute valeur réelle d’un intervalle et possède une densité.

Elle prend des valeurs dans un ensemble dénombrable auxquelles sont associées des probabilités.

Explication

Une variable discrète prend des valeurs appartenant à un ensemble dénombrable, et chaque valeur possède une probabilité associée. Une variable continue peut, elle, prendre toute valeur d’un intervalle et est décrite par une densité.

24. Quelle condition garantit qu’une distribution discrète est une loi de probabilité valide ?

Chaque probabilité est strictement positive, et leur somme vaut le nombre de valeurs.
Les probabilités peuvent dépasser 1 si leur moyenne est égale à 1.
La somme des probabilités peut être inférieure à 1 lorsque certaines valeurs sont rares.
Chaque probabilité est comprise entre 0 et 1, et leur somme vaut 1.

Chaque probabilité est comprise entre 0 et 1, et leur somme vaut 1.

Explication

Une loi discrète valide associe à chaque valeur une probabilité comprise entre 0 et 1, avec une somme totale égale à 1. Une distribution dont la somme diffère de 1 ne représente pas une loi de probabilité.

25. Pour une variable discrète, comment calcule-t-on la fonction de répartition au point x ?

On divise la probabilité de x par la somme des valeurs observées.
On additionne les probabilités des valeurs qui ne dépassent pas x.
On additionne les probabilités des valeurs qui sont strictement supérieures à x.
On multiplie chaque valeur par sa probabilité avant de prendre la plus grande.

On additionne les probabilités des valeurs qui ne dépassent pas x.

Explication

La fonction de répartition vérifie F(x)=Pr⁡(X≤x)F(x)=\Pr(X\le x) et s’obtient en additionnant les probabilités des valeurs xi≤xx_i\le x. Les valeurs supérieures à x ne contribuent donc pas à cette somme.

26. Si une variable suit une loi binomiale de paramètres n et p, quelle expression donne la probabilité d’obtenir x succès ?

(nx)(1−p)xpn−x\binom{n}{x}(1-p)^x p^{n-x}
npx(1−p)n−xnp^x(1-p)^{n-x}
(nx)px(1−p)n−x\binom{n}{x}p^x(1-p)^{n-x}
(xn)pn(1−p)x−n\binom{x}{n}p^n(1-p)^{x-n}

$$\binom{n}{x}p^x(1-p)^{n-x}$$

Explication

Pour une loi binomiale, la probabilité de x succès parmi n essais vaut (nx)pxqn−x\binom{n}{x}p^xq^{n-x} avec q=1−pq=1-p. L’expression doit donc compter les arrangements des succès et associer la puissance p aux succès.

27. Quelle propriété distingue une variable aléatoire continue d’une variable discrète ?

Elle possède nécessairement deux valeurs possibles codées par 0 et 1.
Elle attribue une probabilité positive à chaque valeur exacte de son domaine.
Elle peut prendre toute valeur de son domaine et possède une densité de probabilité.
Elle prend un ensemble dénombrable de valeurs auxquelles sont associées des probabilités.

Elle peut prendre toute valeur de son domaine et possède une densité de probabilité.

Explication

Une variable continue peut prendre n’importe quelle valeur dans son domaine et se décrit par une densité. Une valeur exacte d’une variable continue a une probabilité nulle, contrairement aux valeurs discrètes qui peuvent recevoir une probabilité positive.

28. Une variable continue possède une densité f. Comment calcule-t-on la probabilité qu’elle appartienne à l’intervalle [u,v] ?

Pr⁡(u≤X≤v)=u f(v)−v f(u)\Pr(u\le X\le v)=u\,f(v)-v\,f(u)
Pr⁡(u≤X≤v)=f(v)−f(u)\Pr(u\le X\le v)=f(v)-f(u)
Pr⁡(u≤X≤v)=∫uvf(x) dx\Pr(u\le X\le v)=\int_u^v f(x)\,dx
Pr⁡(u≤X≤v)=∑x=uvf(x)\Pr(u\le X\le v)=\sum_{x=u}^{v}f(x)

$$\Pr(u\le X\le v)=\int_u^v f(x)\,dx$$

Explication

Pour une variable continue, une probabilité sur un intervalle est l’aire sous la densité entre ses deux bornes, soit ∫uvf(x) dx\int_u^v f(x)\,dx. Une somme convient aux variables discrètes, pas à une densité continue.

29. Quelle caractéristique appartient à une loi normale N(m,s2)N(m,s^2) ?

Elle est discrète et attribue une probabilité positive à chaque valeur exacte.
Sa densité en cloche est symétrique autour de m, qui est aussi sa moyenne et sa médiane.
Sa moyenne vaut s², tandis que sa médiane vaut m et sa variance vaut m².
Sa densité est asymétrique autour de s², qui représente sa moyenne et sa médiane.

Sa densité en cloche est symétrique autour de m, qui est aussi sa moyenne et sa médiane.

Explication

La loi normale est une loi continue à densité en cloche, symétrique autour de m ; sa moyenne et sa médiane valent m, tandis que sa variance vaut s². Elle n’est donc pas une loi discrète.

30. Pour standardiser X∼N(m,s2)X\sim N(m,s^2), quelle transformation faut-il appliquer ?

Poser Y=X−msY=\frac{X-m}{s}, de sorte que Y∼N(0,1)Y\sim N(0,1).
Poser Y=X+ms2Y=\frac{X+m}{s^2}, de sorte que Y∼N(1,0)Y\sim N(1,0).
Poser Y=Xm+sY=\frac{X}{m+s}, de sorte que Y∼N(m,s2)Y\sim N(m,s^2).
Poser Y=s(X−m)Y=s(X-m), de sorte que Y∼N(0,s2)Y\sim N(0,s^2).

Poser $$Y=\frac{X-m}{s}$$, de sorte que $$Y\sim N(0,1)$$.

Explication

La standardisation centre X en retranchant m puis réduit son échelle en divisant par s, ce qui donne Y=X−msY=\frac{X-m}{s} et la loi N(0,1)N(0,1). Ajouter la moyenne ou diviser par la variance ne produit pas cette loi centrée réduite.

31. Quelle formule donne la variance de aX+bYaX+bY lorsque X et Y peuvent être associées ?

Var⁡(X)+Var⁡(Y)+2Cov⁡(X,Y)\operatorname{Var}(X)+\operatorname{Var}(Y)+2\operatorname{Cov}(X,Y)
a2Var⁡(X)+b2Var⁡(Y)+2abCov⁡(X,Y)a^2\operatorname{Var}(X)+b^2\operatorname{Var}(Y)+2ab\operatorname{Cov}(X,Y)
aVar⁡(X)+bVar⁡(Y)+Cov⁡(X,Y)a\operatorname{Var}(X)+b\operatorname{Var}(Y)+\operatorname{Cov}(X,Y)
a2Var⁡(X)−b2Var⁡(Y)+abCov⁡(X,Y)a^2\operatorname{Var}(X)-b^2\operatorname{Var}(Y)+ab\operatorname{Cov}(X,Y)

$$a^2\operatorname{Var}(X)+b^2\operatorname{Var}(Y)+2ab\operatorname{Cov}(X,Y)$$

Explication

La variance d’une combinaison linéaire comprend les variances pondérées par les coefficients au carré et le terme de covariance 2abCov⁡(X,Y)2ab\operatorname{Cov}(X,Y). La covariance ne peut donc pas être omise lorsque les variables sont associées.

32. Si X et Y sont indépendantes, quelle expression correspond à Var⁡(aX+bY)\operatorname{Var}(aX+bY) ?

Var⁡(X)+Var⁡(Y)+ab\operatorname{Var}(X)+\operatorname{Var}(Y)+ab
a2Var⁡(X)−b2Var⁡(Y)a^2\operatorname{Var}(X)-b^2\operatorname{Var}(Y)
aVar⁡(X)+bVar⁡(Y)+2abCov⁡(X,Y)a\operatorname{Var}(X)+b\operatorname{Var}(Y)+2ab\operatorname{Cov}(X,Y)
a2Var⁡(X)+b2Var⁡(Y)a^2\operatorname{Var}(X)+b^2\operatorname{Var}(Y)

$$a^2\operatorname{Var}(X)+b^2\operatorname{Var}(Y)$$

Explication

L’indépendance supprime le terme de covariance, si bien que la variance devient a2Var⁡(X)+b2Var⁡(Y)a^2\operatorname{Var}(X)+b^2\operatorname{Var}(Y). La formule générale inclut une covariance lorsque l’indépendance n’est pas supposée.

33. Que prévoit approximativement le théorème central limite pour la moyenne de n variables indépendantes de moyenne m et de variance s², lorsque n est grand ?

1n∑i=1nXi∼N(0,s2)\frac{1}{n}\sum_{i=1}^{n}X_i\sim N\left(0,s^2\right)
∑i=1nXi∼N(m,s2n)\sum_{i=1}^{n}X_i\sim N\left(m,\frac{s^2}{n}\right)
1n∑i=1nXi∼N(mn,s2n)\frac{1}{n}\sum_{i=1}^{n}X_i\sim N\left(\frac{m}{n},s^2n\right)
1n∑i=1nXi∼N(m,s2n)\frac{1}{n}\sum_{i=1}^{n}X_i\sim N\left(m,\frac{s^2}{n}\right)

$$\frac{1}{n}\sum_{i=1}^{n}X_i\sim N\left(m,\frac{s^2}{n}\right)$$

Explication

Pour un échantillon suffisamment grand, la moyenne suit approximativement une loi normale de moyenne m et de variance s2/ns^2/n. Cette conclusion concerne la moyenne de l’échantillon, même si la loi de chaque variable n’est pas normale.

34. Dans un tableau de contingence, comment définit-on le risque relatif d’un événement C selon l’exposition F ?

RR=Pr⁡(C∩F)Pr⁡(C∪F‾)RR=\frac{\Pr(C\cap F)}{\Pr(C\cup\overline F)}
RR=Pr⁡(C∣F)−Pr⁡(C∣F‾)RR=\Pr(C\mid F)-\Pr(C\mid\overline F)
RR=Pr⁡(C∣F)Pr⁡(C∣F‾)RR=\frac{\Pr(C\mid F)}{\Pr(C\mid\overline F)}
RR=Pr⁡(F∣C)Pr⁡(F‾∣C)RR=\frac{\Pr(F\mid C)}{\Pr(\overline F\mid C)}

$$RR=\frac{\Pr(C\mid F)}{\Pr(C\mid\overline F)}$$

Explication

Le risque relatif compare le risque de C chez les exposés au risque de C chez les non-exposés, selon RR=Pr⁡(C∣F)Pr⁡(C∣F‾)RR=\frac{\Pr(C\mid F)}{\Pr(C\mid\overline F)}. Les probabilités conditionnelles inversées et la différence correspondent à d’autres mesures.

35. Dans un tableau comparant tabagisme et cancer, quelle proportion de fumeurs et de non-fumeurs est atteinte d’un cancer lorsque 50 fumeurs sur 100 et 10 non-fumeurs sur 200 sont concernés ?

0,25 chez les fumeurs et 0,10 chez les non-fumeurs
0,50 chez les fumeurs et 0,05 chez les non-fumeurs
0,05 chez les fumeurs et 0,50 chez les non-fumeurs
0,50 chez les deux groupes étudiés

0,50 chez les fumeurs et 0,05 chez les non-fumeurs

Explication

La proportion se calcule en divisant le nombre de cas par l’effectif de chaque groupe : 50/100 = 0,50 et 10/200 = 0,05. La proportion observée chez les fumeurs ne doit donc pas être confondue avec celle observée chez les non-fumeurs.

36. Quelle expression calcule le risque relatif de cancer chez les fumeurs par rapport aux non-fumeurs dans un tableau où a et c concernent les fumeurs, et b et d les non-fumeurs ?

RR=a+bc+dRR=\frac{a+b}{c+d}
RR=a/(a+c)b/(b+d)RR=\frac{a/(a+c)}{b/(b+d)}
RR=a/(a+b)c/(c+d)RR=\frac{a/(a+b)}{c/(c+d)}
RR=a/cb/dRR=\frac{a/c}{b/d}

$$RR=\frac{a/(a+c)}{b/(b+d)}$$

Explication

Le risque relatif compare le risque de cancer dans le groupe des fumeurs à celui des non-fumeurs, d’où RR=a/(a+c)b/(b+d)RR=\frac{a/(a+c)}{b/(b+d)}. L’expression a/cb/d\frac{a/c}{b/d} correspond à un rapport de cotes et non à ce risque relatif.

37. Quelle formule permet de calculer l’odds ratio à partir des quatre cases d’un tableau de contingence ?

OR=a/(a+c)b/(b+d)OR=\frac{a/(a+c)}{b/(b+d)}
OR=a+db+cOR=\frac{a+d}{b+c}
OR=a/cb/d=adbcOR=\frac{a/c}{b/d}=\frac{ad}{bc}
OR=a+bc+dOR=\frac{a+b}{c+d}

$$OR=\frac{a/c}{b/d}=\frac{ad}{bc}$$

Explication

L’odds ratio est le rapport des cotes et se simplifie en OR=a/cb/d=adbcOR=\frac{a/c}{b/d}=\frac{ad}{bc}. La fraction fondée sur les risques dans chaque groupe décrit le risque relatif, pas l’odds ratio.

38. Comment interpréter une mesure d’association telle qu’un risque relatif ou un odds ratio égale à 0,7 ?

Elle indique une absence d’association mesurée entre les variables
Elle indique une association dont l’intensité ne peut pas être interprétée
Elle indique un effet protecteur associé à l’exposition étudiée
Elle indique un facteur aggravant associé à l’exposition étudiée

Elle indique un effet protecteur associé à l’exposition étudiée

Explication

Une valeur inférieure à 1 est interprétée comme un facteur protecteur dans le cadre de cette mesure d’association. Une valeur égale à 1 signalerait plutôt l’absence d’association mesurée, tandis qu’une valeur supérieure à 1 indiquerait un facteur aggravant.

39. Quelle forme prend le modèle d’une régression linéaire reliant une variable réponse y à une variable explicative x ?

Une droite d’équation y=ax+by=ax+b
Une courbe d’équation y=ax2+by=ax^2+b
Une droite d’équation x=ay+bx=ay+b
Une proportion d’équation y=xa+by=\frac{x}{a+b}

Une droite d’équation $$y=ax+b$$

Explication

La régression linéaire représente le lien entre la réponse y et la variable explicative x par une droite, écrite y=ax+by=ax+b. Les autres expressions décrivent soit une autre orientation des variables, soit des formes mathématiques qui ne correspondent pas au modèle linéaire indiqué.

40. Dans une régression linéaire, comment estime-t-on la pente a et l’ordonnée à l’origine b ?

a=var(x)cov(x,y)a=\frac{var(x)}{cov(x,y)} et b=xˉ−ayˉb=\bar x-a\bar y
a=cov(x,y) var(x)a=cov(x,y)\,var(x) et b=yˉ+axˉb=\bar y+a\bar x
a=yˉ−axˉa=\bar y-a\bar x et b=cov(x,y)var(x)b=\frac{cov(x,y)}{var(x)}
a=cov(x,y)var(x)a=\frac{cov(x,y)}{var(x)} et b=yˉ−axˉb=\bar y-a\bar x

$$a=\frac{cov(x,y)}{var(x)}$$ et $$b=\bar y-a\bar x$$

Explication

La pente est obtenue par a=cov(x,y)var(x)a=\frac{cov(x,y)}{var(x)}, puis l’ordonnée à l’origine par b=yˉ−axˉb=\bar y-a\bar x. La pente décrit l’inclinaison de la droite, alors que b correspond à sa valeur lorsque x vaut zéro.

41. Une droite de régression a une pente a=−2,5a=-2,5. Que signifie cette valeur ?

Une hausse d’une unité de X entraîne une baisse moyenne de 2,5 unités de Y
Une hausse d’une unité de Y entraîne une baisse moyenne de 2,5 unités de X
Une baisse d’une unité de X entraîne une baisse moyenne de 2,5 unités de Y
La valeur moyenne de Y lorsque X vaut zéro est égale à -2,5

Une hausse d’une unité de X entraîne une baisse moyenne de 2,5 unités de Y

Explication

Une pente négative signifie que Y diminue lorsque X augmente, et sa valeur absolue indique une variation moyenne de 2,5 unités de Y pour une unité supplémentaire de X. L’ordonnée à l’origine, et non la pente, donne la valeur prévue de Y lorsque X vaut zéro.

42. Pourquoi une corrélation linéaire observée entre deux variables ne permet-elle pas de conclure que l’une cause l’autre ?

Une corrélation compare nécessairement des variables qualitatives
Le coefficient de corrélation ne peut prendre que des valeurs positives
Un facteur de confusion peut expliquer leur variation simultanée
La pente d’une droite de régression ne dépend pas des données observées

Un facteur de confusion peut expliquer leur variation simultanée

Explication

Deux variables peuvent varier ensemble parce qu’un troisième facteur influence simultanément chacune d’elles. Une corrélation décrit une association linéaire, mais elle ne suffit pas à établir un lien causal.

43. Dans une relation entre deux variables quantitatives, quel rôle jouent respectivement x et y ?

x est la variable explicative et y est la variable réponse
x est la variable réponse et y est la variable explicative
x est la variable de confusion et y est la variable explicative
x est la variable qualitative et y est la variable quantitative

x est la variable explicative et y est la variable réponse

Explication

Dans ce cadre, x désigne la variable explicative ou indépendante, tandis que y désigne la variable réponse ou dépendante. Inverser ces rôles modifierait l’interprétation de la relation étudiée.

44. Une variable qualitative binaire est codée 0 et 1 dans le modèle y=ax+by=ax+b. Que représente le coefficient a ?

La différence entre les effectifs des groupes codés 1 et 0
La moyenne générale de y dans les deux groupes réunis
La moyenne de y dans le groupe codé 0
La différence moyenne de y entre le groupe codé 1 et le groupe codé 0

La différence moyenne de y entre le groupe codé 1 et le groupe codé 0

Explication

Dans ce codage, b représente la moyenne du groupe codé 0, tandis qu'a mesure l’écart moyen entre les groupes codés 1 et 0. Le coefficient a ne correspond donc pas à l’effectif des groupes ni à leur moyenne générale.

45. Comment intégrer une variable qualitative comportant trois modalités dans une régression ?

Comparer chaque modalité aux deux autres avec un seul coefficient commun
Attribuer aux trois modalités les valeurs 0, 1 et 2 puis interpréter chaque coefficient comme une moyenne
Choisir une catégorie de référence et comparer chaque autre modalité à celle-ci
Fusionner les trois modalités en une variable binaire avant d’ajuster le modèle

Choisir une catégorie de référence et comparer chaque autre modalité à celle-ci

Explication

Avec trois modalités, on choisit une catégorie de référence puis on estime séparément l’écart associé à chacune des deux autres catégories. Le codage direct 0, 1 et 2 imposerait une structure d’écarts entre catégories qui n’est généralement pas justifiée.

46. Quelle distinction décrit correctement les directions de raisonnement entre échantillonnage et estimation ?

L’échantillonnage va de la population vers l’échantillon, tandis que l’estimation va de l’échantillon vers la population.
L’échantillonnage calcule une valeur théorique, tandis que l’estimation sélectionne les individus au hasard.
L’échantillonnage va de l’échantillon vers la population, tandis que l’estimation va de la population vers l’échantillon.
L’échantillonnage compare deux groupes, tandis que l’estimation décrit la fluctuation entre plusieurs échantillons.

L’échantillonnage va de la population vers l’échantillon, tandis que l’estimation va de l’échantillon vers la population.

Explication

L’échantillonnage utilise une population pour anticiper les résultats d’un échantillon, alors que l’estimation utilise un échantillon pour déduire des caractéristiques de la population. La comparaison de groupes ou avec une valeur théorique relève plutôt du test statistique.

47. Comment appelle-t-on la variation des résultats obtenus lorsque plusieurs échantillons sont tirés d’une même population ?

La fluctuation d’échantillonnage
La stabilité d’estimation
La représentativité populationnelle
La correction de variance

La fluctuation d’échantillonnage

Explication

La fluctuation d’échantillonnage désigne les différences entre les résultats produits par plusieurs échantillons issus de la même population. La correction de variance concerne l’ajustement d’un estimateur, et non la variation entre échantillons.

48. Dans quelle situation un échantillon est-il considéré comme représentatif plutôt que biaisé ?

Lorsqu’il est formé par les personnes les plus faciles à contacter
Lorsqu’il est composé de participants choisis selon leur préférence
Lorsqu’il est constitué après exclusion des réponses atypiques
Lorsqu’il est tiré au sort dans la population étudiée

Lorsqu’il est tiré au sort dans la population étudiée

Explication

Un échantillon tiré au sort est considéré comme représentatif de la population dans cette distinction. Les autres méthodes reposent sur une sélection non aléatoire et peuvent introduire un biais.

49. Pour une moyenne avec une taille d’échantillon d’au moins 30, quelle expression donne l’intervalle de pari lorsque la variance populationnelle est connue ?

[m^−tn−1,αs^n;m^+tn−1,αs^n]\left[\hat m-t_{n-1,\alpha}\frac{\hat s}{\sqrt n};\hat m+t_{n-1,\alpha}\frac{\hat s}{\sqrt n}\right]
[p^−zαp^q^n;p^+zαp^q^n]\left[\hat p-z_\alpha\sqrt{\frac{\hat p\hat q}{n}};\hat p+z_\alpha\sqrt{\frac{\hat p\hat q}{n}}\right]
[μ−zασ2n;μ+zασ2n]\left[\mu-z_\alpha\sqrt{\frac{\sigma^2}{n}};\mu+z_\alpha\sqrt{\frac{\sigma^2}{n}}\right]
[so2nn−1;so2n−1n]\left[s_o^2\frac{n}{n-1};s_o^2\frac{n-1}{n}\right]

$$\left[\mu-z_\alpha\sqrt{\frac{\sigma^2}{n}};\mu+z_\alpha\sqrt{\frac{\sigma^2}{n}}\right]$$

Explication

Lorsque la variance populationnelle est connue et que la taille de l’échantillon atteint 30, l’intervalle de pari pour une moyenne est centré sur μ\mu et utilise l’écart-type σ\sigma. La deuxième expression concerne une moyenne avec petite taille et variance inconnue, tandis que la troisième concerne une proportion.

50. Que décrit principalement un intervalle de pari, par opposition à un intervalle de confiance ?

La probabilité qu’un échantillon sélectionné au hasard soit représentatif
La différence entre deux moyennes observées dans des groupes distincts
La variabilité de la valeur observée à partir des paramètres de la population
La valeur inconnue de la population estimée à partir des paramètres de l’échantillon

La variabilité de la valeur observée à partir des paramètres de la population

Explication

L’intervalle de pari est construit à partir des valeurs de la population et décrit la variabilité d’une valeur observée. L’intervalle de confiance utilise plutôt les estimations de l’échantillon pour viser la vraie valeur de la population.

51. Quelle est la fonction d’un intervalle de confiance construit à partir d’un échantillon ?

Décrire la variation des échantillons lorsque les paramètres sont connus
Fournir une seule valeur observée sans indication d’incertitude
Contenir la valeur inconnue de la population avec une confiance fixée
Comparer une observation à une hypothèse nulle prédéfinie

Contenir la valeur inconnue de la population avec une confiance fixée

Explication

Un intervalle de confiance fournit une plage construite à partir de l’échantillon, destinée à contenir la valeur inconnue de la population avec un niveau de confiance fixé. Une seule valeur correspond à une estimation ponctuelle, qui ne décrit pas une plage d’incertitude.

52. Une variance empirique vaut so2=12s_o^2=12 pour un échantillon de taille n=6n=6. Quelle est la valeur de l’estimateur sans biais de la variance ?

7272
14,414{,}4
12,212{,}2
1010

$$14{,}4$$

Explication

L’estimateur sans biais vaut s^2=so2nn−1=12×65=14,4\hat{s}^2=s_o^2\frac{n}{n-1}=12\times\frac{6}{5}=14{,}4. La valeur 1212 correspond à la variance empirique non corrigée, tandis que les autres valeurs n’appliquent pas le facteur prévu.

53. Quelle loi et quelle forme d’intervalle conviennent à une moyenne lorsque n<30n<30, que la population est normale et que la variance est inconnue ?

La loi binomiale avec une marge fondée sur p^q^/n\hat p\hat q/n
La loi de Student avec n−1n-1 degrés de liberté et une marge fondée sur s^/n\hat s/\sqrt n
La loi du khi-deux avec une marge fondée sur so2n/(n−1)s_o^2n/(n-1)
La loi normale avec variance connue et une marge fondée sur σ/n\sigma/\sqrt n

La loi de Student avec $$n-1$$ degrés de liberté et une marge fondée sur $$\hat s/\sqrt n$$

Explication

Dans cette situation, l’intervalle utilise la loi de Student à n−1n-1 degrés de liberté et la marge tn−1,αs^/nt_{n-1,\alpha}\hat s/\sqrt n. La loi normale correspond à une autre configuration, tandis que les deux autres expressions concernent une proportion ou une variance.

54. Quelle comparaison correspond à un test statistique portant sur une observation et une référence théorique ?

Comparer deux estimations issues de tirages successifs dans une même population
Comparer la taille de deux échantillons avant leur analyse statistique
Comparer les moyennes observées de deux échantillons indépendants
Comparer la moyenne observée d’un échantillon à une valeur théorique de la population

Comparer la moyenne observée d’un échantillon à une valeur théorique de la population

Explication

Un test peut comparer une observation à une valeur théorique en tenant compte de la fluctuation d’échantillonnage. La comparaison de deux observations constitue une autre situation de test, tandis que les autres propositions ne décrivent pas les deux configurations définies.

55. Quel rôle joue l’hypothèse nulle H0H_0 dans un test statistique ?

Elle fixe la puissance du test à partir de la probabilité de faux négatif
Elle indique que l’échantillon a été sélectionné par un tirage aléatoire
Elle suppose que le hasard explique l’écart observé par rapport à la référence
Elle affirme que la différence recherchée est présente dans la population étudiée

Elle suppose que le hasard explique l’écart observé par rapport à la référence

Explication

L’hypothèse nulle considère que l’écart constaté peut s’expliquer par le hasard, en l’absence de différence ou dans l’état de référence. L’hypothèse de différence recherchée correspond plutôt à H1H_1, et la puissance dépend de β\beta.

56. Quelle situation constitue une erreur de type I dans un test statistique ?

Rejeter H0H_0 alors qu’elle est vraie, ce qui correspond au risque α\alpha
Rejeter H0H_0 alors qu’elle est fausse, ce qui correspond à la puissance
Ne pas rejeter H0H_0 alors qu’elle est vraie, ce qui correspond au risque α\alpha
Ne pas rejeter H0H_0 alors qu’elle est fausse, ce qui correspond au risque β\beta

Rejeter $$H_0$$ alors qu’elle est vraie, ce qui correspond au risque $$\alpha$$

Explication

L’erreur de type I est un faux positif : on rejette une hypothèse nulle pourtant vraie, avec un risque noté α\alpha. Ne pas rejeter une hypothèse nulle fausse correspond à l’erreur de type II, associée à β\beta.

57. Un test présente un risque d’erreur de type II égal à β=0,20\beta=0{,}20. Quelle est sa puissance statistique ?

0,040{,}04
0,200{,}20
0,800{,}80
1,201{,}20

$$0{,}80$$

Explication

La puissance statistique est la probabilité de rejeter H0H_0 lorsque H1H_1 est vraie, et elle vaut 1−β1-\beta. Avec β=0,20\beta=0{,}20, on obtient donc 1−0,20=0,801-0{,}20=0{,}80.

58. Pour comparer une proportion observée pop_o à une proportion théorique π\pi, quelle statistique de test faut-il utiliser ?

zo=po−πnπ(1−π)z_o=\frac{p_o-\pi}{\sqrt{n\pi(1-\pi)}}
zo=po−πpo(1−po)/nz_o=\frac{p_o-\pi}{\sqrt{p_o(1-p_o)/n}}
zo=po+ππ(1−π)nz_o=\frac{p_o+\pi}{\sqrt{\pi(1-\pi)n}}
zo=po−ππ(1−π)/nz_o=\frac{p_o-\pi}{\sqrt{\pi(1-\pi)/n}}

$$z_o=\frac{p_o-\pi}{\sqrt{\pi(1-\pi)/n}}$$

Explication

La statistique compare l’écart entre la proportion observée et la proportion théorique à son erreur standard calculée sous H0H_0. La proportion observée ne remplace pas π\pi dans le dénominateur pour ce test.

59. Pour tester une moyenne observée contre une moyenne théorique avec un échantillon de 20 sujets, quelle statistique convient sous l’hypothèse de normalité de la variable ?

Une statistique du khi deux à 19 degrés de liberté
Une statistique de Student à 19 degrés de liberté
Une statistique normale standard sans condition supplémentaire
Une statistique de Student à 20 degrés de liberté

Une statistique de Student à 19 degrés de liberté

Explication

Lorsque n<30n<30, la comparaison d’une moyenne utilise une statistique de Student à n−1n-1 degrés de liberté, ici 19. La statistique normale est réservée au cas où l’effectif atteint au moins 30 dans cette règle.

60. Dans une étude mesurant la tension artérielle des mêmes patients avant et après traitement, quelle quantité faut-il analyser pour comparer les deux moyennes ?

La différence entre les moyennes de deux groupes sans appariement
La corrélation entre les mesures de patients différents
La moyenne des différences calculées pour chaque patient
La moyenne des valeurs avant traitement chez chaque patient

La moyenne des différences calculées pour chaque patient

Explication

Les mesures avant et après sont appariées, car elles proviennent des mêmes sujets : l’analyse porte donc sur les différences intra-sujet. Comparer directement deux moyennes indépendantes ne tient pas compte de cet appariement.

61. Dans un test du khi deux d’ajustement, que représentent les quantités OiO_i et CiC_i dans la statistique ∑i=1k(Oi−Ci)2Ci\sum_{i=1}^{k}\frac{(O_i-C_i)^2}{C_i} ?

Les effectifs calculés et les probabilités observées sous H0H_0
Les effectifs observés et calculés sous H0H_0
Les moyennes observées et les effectifs cumulés sous H0H_0
Les proportions observées et les variances calculées sous H0H_0

Les effectifs observés et calculés sous $$H_0$$

Explication

Dans ce test, OiO_i désigne l’effectif observé dans la catégorie ii et CiC_i l’effectif attendu sous H0H_0. Les proportions et les variances ne sont pas les deux composantes de cette statistique.

62. Quelle situation correspond à la définition d’une variable de survie ?

Le temps écoulé avant une négativation de la charge virale
Le nombre de traitements prescrits pendant une consultation
La proportion de patients guéris à une date donnée
La valeur d’une mesure biologique à la fin du suivi

Le temps écoulé avant une négativation de la charge virale

Explication

Une variable de survie mesure le délai avant la survenue d’un événement, qui peut être une négativation virale aussi bien qu’un décès. Elle ne se limite donc pas aux événements mortels.

63. Un patient est encore suivi à la date d’analyse sans avoir présenté l’événement étudié : comment cette observation doit-elle être interprétée ?

Comme une observation censurée dont la durée exacte reste inconnue
Comme une donnée exclue car aucune durée n’a été mesurée
Comme une observation non censurée avec événement observé
Comme une absence définitive d’événement durant toute sa vie

Comme une observation censurée dont la durée exacte reste inconnue

Explication

Il s’agit d’une censure, car l’événement n’est pas encore observé à la fin du suivi et son instant exact reste inconnu. Une censure ne signifie pas que l’événement ne surviendra pas ultérieurement.

64. Quelles sont les deux variables nécessaires pour caractériser la durée de survie d’un patient ?

La durée TT et la moyenne des durées observées
L’indicateur CC et la date de naissance du patient
La durée TT et l’indicateur de censure CC
La probabilité de survie et le nombre de patients inclus

La durée $$T$$ et l’indicateur de censure $$C$$

Explication

La durée TT indique le temps mesuré, tandis que CC précise si l’événement a été observé ou si l’observation est censurée. Une date personnelle ou une moyenne de groupe ne fournit pas cette information individuelle.

65. Si F(t)F(t) désigne la fonction de répartition du temps de survie, quelle relation définit la fonction de survie ?

S(t)=Pr⁡(T>t)=1−F(t)S(t)=\Pr(T>t)=1-F(t)
S(t)=Pr⁡(T≤t)=F(t)S(t)=\Pr(T\leq t)=F(t)
S(t)=Pr⁡(T=t)=1−F(t)S(t)=\Pr(T=t)=1-F(t)
S(t)=Pr⁡(T>t)=F(t)S(t)=\Pr(T>t)=F(t)

$$S(t)=\Pr(T>t)=1-F(t)$$

Explication

La fonction de survie est la probabilité que le temps d’événement dépasse tt, soit le complément de la probabilité qu’il soit inférieur ou égal à tt. La fonction de répartition F(t)F(t) décrit précisément cette dernière probabilité.

66. Pour un patient censuré, à quelle date correspond le temps de survie enregistré ?

À la date estimée de l’événement qui aurait pu survenir
À la date du début du traitement suivant l’inclusion
À la date moyenne des événements observés dans l’étude
À la date de sa dernière nouvelle ou de la fin du suivi

À la date de sa dernière nouvelle ou de la fin du suivi

Explication

En cas de censure, le temps enregistré va de la date d’origine jusqu’à la dernière nouvelle ou la fin du suivi. Il ne correspond pas à une date d’événement supposée, puisque cet événement n’a pas été observé.

67. Que représente S(t)S(t) dans la relation S(t)=Pr⁡(T>t)=1−F(t)S(t)=\Pr(T>t)=1-F(t) ?

La probabilité que le temps de survie soit inférieur ou égal à tt
La proportion de patients censurés avant la date tt
La probabilité que le temps de survie dépasse tt
La probabilité que l’événement se produise exactement à tt

La probabilité que le temps de survie dépasse $$t$$

Explication

S(t)S(t) mesure la probabilité de dépasser le temps tt, tandis que F(t)F(t) mesure la probabilité de ne pas le dépasser. Une probabilité d’événement exactement à tt est une notion différente.

68. Sur une courbe de survie en marches d’escalier, quel effet produit une observation censurée ?

Elle ne modifie pas immédiatement la hauteur de la courbe
Elle provoque une baisse de la courbe comme un événement
Elle ramène la courbe à sa valeur initiale de survie
Elle remplace la courbe par une ligne continue jusqu’au suivi suivant

Elle ne modifie pas immédiatement la hauteur de la courbe

Explication

Les baisses de la courbe correspondent aux événements observés, tandis qu’un trait de censure ne change pas immédiatement sa hauteur. La censure indique toutefois qu’un sujet sort du groupe à risque pour les temps ultérieurs.

69. Comment détermine-t-on la médiane de survie à partir d’une courbe lorsque S(t)=0,5S(t)=0,5 n’est atteint à aucun instant précis ?

On retient le plus petit temps pour lequel S(t)≥0,5S(t)\geq0,5
On choisit le temps où la courbe commence à décroître
On calcule la moyenne des temps de tous les événements
On retient le plus grand temps pour lequel S(t)≤0,5S(t)\leq0,5

On retient le plus petit temps pour lequel $$S(t)\geq0,5$$

Explication

La médiane correspond au 50e quantile et, lorsque la valeur 0,5 n’est pas atteinte exactement, on utilise le plus petit temps vérifiant S(t)≥0,5S(t)\geq0,5. Le début d’une décroissance ou une moyenne des événements ne définit pas cette médiane.

Révisez avec les flashcards

Mémorisez les réponses avec 87 flashcards sur Associations et estimation statistique.

Qu'est-ce que la biostatistique ?

La statistique appliquée aux sciences du vivant, à la biologie et à la médecine.

Que permet d'évaluer la biostatistique ?

Une valeur biologique normale, l’intérêt d’un examen, le risque d’une complication et l’efficacité comparative de traitements.

Quel est le rôle principal de la biostatistique dans l'observation ?

Passer de l’observation sur un échantillon à une généralisation sur une population plus large.

Voir les flashcards →

Approfondir avec la fiche

Consultez la fiche de révision complète sur Associations et estimation statistique.

Voir la fiche →

Cours similaires

Crée tes propres QCM

Importe ton cours et l'IA génère des QCM avec corrections en 30 secondes.

Générateur de QCM