QCM : Formules R pour l’analyse statistique — 23 questions

Questions et réponses du QCM

1. Quelle séquence permet de préparer une analyse d’un fichier CSV avec les jeux de données de MASS dans R ?

Définir le répertoire, convertir les chaînes, puis résumer le fichier avec summary
Charger MASS, sélectionner une ligne, puis comparer les colonnes avec ==
Charger MASS, définir le répertoire, puis importer le fichier avec read.table
Importer le fichier, charger MASS, puis afficher les modalités avec levels

Charger MASS, définir le répertoire, puis importer le fichier avec read.table

Explication

La préparation consiste à lancer library(MASS), éventuellement consulter l’aide, définir le répertoire avec setwd(), puis importer le fichier avec read.table(). L’importation directe sans définir le répertoire peut toutefois fonctionner si le fichier se trouve déjà dans le répertoire courant.

2. Dans read.table, que signifie l’argument row.names=1 ?

La première ligne est interprétée comme commentaire
La première colonne est séparée avec un point-virgule
La première colonne est utilisée comme noms de lignes
La première ligne est utilisée comme noms de colonnes

La première colonne est utilisée comme noms de lignes

Explication

L’argument row.names=1 demande à R d’utiliser la première colonne comme noms de lignes. Il ne désigne pas la première ligne comme en-tête, rôle assuré par header=TRUE.

3. Quelle fonction permet d’obtenir simultanément le nombre de lignes et de colonnes d’un tableau d ?

names(d)
str(d)
rownames(d)
dim(d)

dim(d)

Explication

La fonction dim(d) renvoie les dimensions du tableau, c’est-à-dire son nombre de lignes et de colonnes. La fonction str(d) décrit plutôt la structure et le type des variables.

4. Le poids mesuré pour chaque individu correspond à quel type de variable ?

Une variable quantitative discrète
Une variable qualitative catégorielle
Une variable quantitative continue
Une variable logique binaire

Une variable quantitative continue

Explication

Le poids est une mesure pouvant prendre de nombreuses valeurs sur un continuum, ce qui en fait une variable quantitative continue. Une variable discrète prend plutôt un nombre limité de valeurs entières.

5. Quelle expression R extrait la colonne j entière du tableau d ?

d[i, j]
d[, j]
d[j, ]
d[i, ]

d[, j]

Explication

L’expression d[, j] sélectionne toutes les lignes de la colonne j. La confusion fréquente consiste à utiliser d[i, ], qui extrait au contraire la ligne i entière.

6. Quelle expression teste correctement si une variable x est égale à 10 dans R ?

x = 10
x >= 10
x == 10
x != 10

x == 10

Explication

L’opérateur == compare x à 10 et teste leur égalité. Le symbole = sert notamment à attribuer une valeur ou à nommer un argument, tandis que != teste l’inégalité.

7. Quelle commande extrait de d les individus dont x est supérieur à 10 et dont sex vaut « F » ?

subset(d, x > 10 & sex == "F")
sum(d$x > 10 & sex == "F")
which(d$x > 10 & sex == "F")
subset(d, x > 10 | sex == "F")

subset(d, x > 10 & sex == "F")

Explication

subset(d, x > 10 & sex == "F") conserve les lignes qui satisfont simultanément les deux conditions. La fonction which() renverrait leurs positions, tandis que l’opérateur | accepterait l’une ou l’autre condition.

8. Quelle commande R permet d’obtenir les proportions correspondant aux modalités d’une variable qualitative x ?

names(which.max(table(x)))
table(prop.table(x))
prop.table(table(x))
summary(prop.table(x))

prop.table(table(x))

Explication

La commande prop.table(table(x)) transforme les effectifs des modalités en proportions. table(x) fournit des effectifs, tandis que names(which.max(table(x))) identifie seulement la modalité la plus fréquente.

9. Quelle information fait partie des résultats fournis par summary(x) pour une variable numérique ?

Le premier et le troisième quartiles
La fréquence de chaque modalité
La pente d’une droite de régression
La covariance entre deux variables

Le premier et le troisième quartiles

Explication

summary(x) fournit notamment les quartiles, la médiane, la moyenne, les extrêmes et les valeurs manquantes éventuelles. Les autres réponses concernent des analyses qui ne sont pas produites par cette commande.

10. Une variable possède un maximum égal à 18 et un minimum égal à 5. Quelle est son étendue ?

5
18
13
23

13

Explication

L’étendue se calcule par la différence entre le maximum et le minimum, soit 18−5=1318-5=13. La valeur 5 est le minimum et 18 le maximum, pas l’étendue.

11. On souhaite calculer la moyenne de y séparément pour toutes les modalités de g. Quelle expression convient ?

tapply(d$y, d$g, mean)
mean(d$y, d$g)
tapply(d$g, d$y, mean)
mean(d$y[d$g == "A"])

tapply(d$y, d$g, mean)

Explication

tapply(d$y, d$g, mean) applique la moyenne à chaque groupe défini par g. mean(d$y[d$g == "A"]) ne concerne qu’un groupe choisi, ici le groupe A.

12. Quelle commande applique une fonction à un tableau séparément pour chaque groupe défini par d$g ?

colMeans(d[, 1:4])
cor(d$g, d[, 1:4])
by(d[, 1:4], d$g, cor)
mean(d[, 1:4])

by(d[, 1:4], d$g, cor)

Explication

by(d[, 1:4], d$g, cor) applique la corrélation au tableau groupe par groupe. colMeans(d[, 1:4]) calcule une moyenne pour chaque colonne sans effectuer de regroupement.

13. Quel graphique convient le mieux pour représenter la distribution d’une mesure quantitative continue ?

Un tableau d’effectifs
Un diagramme circulaire
Un histogramme
Un diagramme en bâtons

Un histogramme

Explication

Une mesure quantitative continue se représente notamment par un histogramme, qui regroupe les observations en classes. Le diagramme en bâtons convient plutôt aux catégories ou aux petits dénombrements discrets.

14. Quelle fonction R produit un histogramme à partir d’une variable quantitative x ?

pie(table(x))
barplot(table(x))
hist(x)
boxplot(x)

hist(x)

Explication

hist(x) regroupe les valeurs quantitatives continues en classes et produit un histogramme. barplot(table(x)) représente des effectifs par catégorie, tandis que pie() produit un camembert et boxplot() une boîte à moustaches.

15. Que produit l’expression boxplot(y ~ g, data=d) ?

Une boîte à moustaches pour chaque colonne numérique de d
Un histogramme de y séparé selon les modalités de g
Des boîtes à moustaches de y, une pour chaque groupe de g
Un diagramme en bâtons des effectifs de chaque groupe

Des boîtes à moustaches de y, une pour chaque groupe de g

Explication

La formule boxplot(y ~ g, data=d) compare la distribution de y entre les groupes définis par g, avec une boîte par groupe. L’expression boxplot(d[, 1:4]) produirait plutôt une boîte par colonne sélectionnée.

16. Dans une fonction graphique de R, quelles options permettent respectivement d’ajouter un titre, un nom à l’axe des abscisses et un nom à l’axe des ordonnées ?

`title`, `xaxis` et `yaxis`
`main`, `xlab` et `ylab`
`names`, `col` et `main`
`pch`, `xlim` et `ylim`

`main`, `xlab` et `ylab`

Explication

Les arguments `main`, `xlab` et `ylab` ajoutent respectivement le titre, l’étiquette de l’axe des abscisses et celle de l’axe des ordonnées. Les arguments `xlim` et `ylim` concernent les bornes des axes, tandis que `pch` concerne la forme des points.

17. Quelle configuration de `par(mfrow=...)` affiche deux graphiques sur une ligne avant de revenir à une seule zone graphique ?

`par(mfrow=c(1, 2))`, puis `par(mfrow=c(1, 1))`
`par(mfrow=c(2, 2))`, puis `par(mfrow=c(2, 1))`
`par(mfrow=c(1, 1))`, puis `par(mfrow=c(2, 2))`
`par(mfrow=c(2, 1))`, puis `par(mfrow=c(1, 2))`

`par(mfrow=c(1, 2))`, puis `par(mfrow=c(1, 1))`

Explication

`mfrow=c(1, 2)` organise deux graphiques sur une ligne et deux colonnes, tandis que `mfrow=c(1, 1)` rétablit une seule zone graphique. La configuration `c(2, 1)` empile plutôt deux graphiques sur deux lignes.

18. Quelle instruction produit un nuage de points représentant `y` en fonction de `x`, avec `x` sur l’axe horizontal ?

`plot(x ~ y, data=d)`
`plot(x, y)`
`pairs(x, y)`
`plot(y, x)`

`plot(x, y)`

Explication

`plot(x, y)` place `x` en abscisse et `y` en ordonnée, ce qui représente y en fonction de x. `plot(x ~ y, data=d)` inverse les rôles des deux variables dans la formule.

19. Quelle distinction entre les corrélations de Pearson et de Spearman est correcte lorsqu’une relation entre deux variables est courbe mais monotone ?

Les deux méthodes mesurent la même liaison et donnent nécessairement le même résultat
Pearson mesure la monotonie, tandis que Spearman exige une relation strictement linéaire
Pearson mesure la linéarité, tandis que Spearman peut mesurer cette monotonie courbe
Pearson décrit la force des catégories, tandis que Spearman compare leurs couleurs

Pearson mesure la linéarité, tandis que Spearman peut mesurer cette monotonie courbe

Explication

La corrélation de Pearson évalue une liaison linéaire, alors que celle de Spearman évalue une liaison monotone, y compris lorsqu’elle est courbe. Une relation monotone non linéaire peut donc être mieux décrite par Spearman.

20. Une corrélation égale à −0,8-0,8 indique quelle situation ?

Une liaison croissante forte
Une liaison croissante faible
Une liaison décroissante forte
Une liaison décroissante modérée

Une liaison décroissante forte

Explication

Le signe négatif indique une liaison décroissante et la valeur absolue de −0,8-0,8, supérieure à 0,70,7, indique une liaison forte. Une valeur positive aurait signalé une liaison croissante.

21. Que peut suggérer une corrélation de Spearman nettement supérieure à celle de Pearson, après examen du nuage de points ?

Une liaison linéaire parfaitement symétrique
Une absence complète de relation entre les variables
Une liaison non linéaire mais monotone
Une erreur certaine dans les noms des variables

Une liaison non linéaire mais monotone

Explication

Lorsque Spearman est nettement supérieur à Pearson, cela peut indiquer une liaison monotone non linéaire. Le nuage de points doit toutefois être vérifié, car les coefficients ne suffisent pas à eux seuls pour interpréter la forme de la relation.

22. Quelle vérification est pertinente lorsqu’un objet R est introuvable après l’appel d’une fonction ou d’un objet connu ?

Remplacer les valeurs manquantes par des zéros et relancer le graphique
Vérifier l’appel de `library(MASS)` et respecter les majuscules
Ajouter `use="complete.obs"` afin de charger les objets absents
Utiliser `getwd()` pour modifier automatiquement le nom de l’objet

Vérifier l’appel de `library(MASS)` et respecter les majuscules

Explication

Un objet introuvable peut résulter d’un paquet non chargé, comme `MASS`, ou d’une faute de frappe, notamment parce que R distingue les majuscules des minuscules. Les autres commandes concernent respectivement les valeurs manquantes ou les fichiers et répertoires.

23. Quelle combinaison permet de traiter des valeurs manquantes dans une statistique puis dans une corrélation avec R ?

`na.omit=FALSE` pour la statistique et `method="missing"` dans `cor`
`na.rm=TRUE` pour la statistique et `use="complete.obs"` dans `cor`
`use="complete.obs"` pour la statistique et `na.rm=TRUE` dans `cor`
`levels()` pour la statistique et `getwd()` dans `cor`

`na.rm=TRUE` pour la statistique et `use="complete.obs"` dans `cor`

Explication

L’argument `na.rm=TRUE` sert à ignorer les valeurs manquantes dans les fonctions statistiques, tandis que `use="complete.obs"` s’emploie avec `cor`. Inverser ces arguments ne correspond pas à leur usage prévu.

Révisez avec les flashcards

Mémorisez les réponses avec 60 flashcards sur Formules R pour l’analyse statistique.

Quelle commande lance la bibliothèque MASS en R ?

library(MASS) lance la bibliothèque MASS.

Que fait l'argument header=TRUE dans read.table ?

Il indique que la première ligne contient les noms.

Que fait l'affectation d <- Aids2 en R ?

Elle stocke le jeu de données Aids2 sous le nom d.

Voir les flashcards →

Approfondir avec la fiche

Consultez la fiche de révision complète sur Formules R pour l’analyse statistique.

Voir la fiche →

Cours similaires

Crée tes propres QCM

Importe ton cours et l'IA génère des QCM avec corrections en 30 secondes.

Générateur de QCM