QCM : Analyse en composantes principales — 31 questions

Questions et réponses du QCM

1. Quel est l’objectif central de la statistique descriptive multidimensionnelle ?

Estimer la probabilité d’un événement à partir d’une seule variable
Prévoir la valeur future d’une variable à partir d’un modèle
Tester une hypothèse concernant la moyenne d’une population
Étudier simultanément plusieurs variables d’un même ensemble de données

Étudier simultanément plusieurs variables d’un même ensemble de données

Explication

La statistique descriptive multidimensionnelle analyse plusieurs variables simultanément afin de décrire leurs informations conjointes. L’estimation probabiliste et les tests d’hypothèses relèvent plutôt de méthodes inférentielles.

2. Quelle caractéristique distingue les méthodes de statistique descriptive multidimensionnelle des méthodes fondées sur un modèle probabiliste ?

Elles calculent des probabilités avant d’examiner la structure des données
Elles prédisent une variable cible à partir d’observations antérieures
Elles imposent une loi normale pour toutes les variables étudiées
Elles explorent les données sans supposer un modèle probabiliste a priori

Elles explorent les données sans supposer un modèle probabiliste a priori

Explication

Ces méthodes sont descriptives ou exploratoires et ne reposent pas sur un modèle probabiliste fixé avant l’analyse. L’imposition d’une loi ou le calcul préalable de probabilités correspondrait à une démarche modélisatrice différente.

3. Que cherche principalement à accomplir l’Analyse de Données lorsqu’elle traite un grand tableau ?

Remplacer les observations par des probabilités théoriques
Déterminer une catégorie connue pour chaque nouvel individu
Résumer et visualiser l’information pertinente qu’il contient
Établir une loi probabiliste complète pour chaque variable

Résumer et visualiser l’information pertinente qu’il contient

Explication

L’Analyse de Données regroupe des méthodes descriptives destinées à synthétiser et représenter l’information importante d’un tableau volumineux. La prédiction de catégories et la construction de lois probabilistes répondent à d’autres objectifs.

4. Quelle distinction décrit correctement les méthodes factorielles et les méthodes de classification ?

Les méthodes factorielles prédisent des catégories, tandis que la classification calcule des facteurs résumant les variables
Les méthodes factorielles imposent des groupes connus, tandis que la classification recherche une faible dimension
Les méthodes factorielles sélectionnent une variable cible, tandis que la classification représente les variables par des axes
Les méthodes factorielles construisent des facteurs résumant les données, tandis que la classification regroupe les individus proches

Les méthodes factorielles construisent des facteurs résumant les données, tandis que la classification regroupe les individus proches

Explication

Les méthodes factorielles réduisent l’information à quelques facteurs et représentent individus et variables par des nuages de points. La classification vise plutôt à former des groupes selon la proximité entre individus.

5. Une analyse doit-elle former des groupes sans catégorie cible connue ou prédire la catégorie de nouveaux individus à partir de catégories déjà établies ? Quelle méthode correspond à chaque situation ?

La classification supervisée forme les groupes sans cible, tandis que la classification non supervisée prédit des catégories connues
La classification non supervisée forme les groupes sans cible, tandis que la classification supervisée prédit des catégories connues
La classification non supervisée résume les variables, tandis que la classification supervisée construit des composantes principales
La classification supervisée représente les individus sur des axes, tandis que la classification non supervisée estime des probabilités

La classification non supervisée forme les groupes sans cible, tandis que la classification supervisée prédit des catégories connues

Explication

La classification non supervisée recherche une structure de groupes en l’absence de variable cible. La classification supervisée apprend à prédire une catégorie à partir de catégories connues.

6. Sur quel type de variables l’Analyse en Composantes Principales porte-t-elle directement ?

Des variables qualitatives organisées en catégories
Des catégories connues associées à chaque individu
Des variables exclusivement constituées de rangs
Des variables quantitatives étudiées simultanément

Des variables quantitatives étudiées simultanément

Explication

L’ACP est une méthode conçue pour étudier simultanément plusieurs variables quantitatives. Les variables qualitatives relèvent notamment de l’AFC ou de l’ACM.

7. Quel changement l’ACP réalise-t-elle pour résumer un ensemble de variables ?

Elle supprime les variables les plus dispersées afin de garder celles qui varient le moins
Elle transforme les variables quantitatives en modalités qualitatives sans réduire leur nombre
Elle conserve toutes les variables initiales et ajoute une catégorie prédite à chaque individu
Elle remplace les variables initiales par moins de composantes en perdant le moins d’information possible

Elle remplace les variables initiales par moins de composantes en perdant le moins d’information possible

Explication

L’ACP construit un nombre réduit de nouvelles variables, appelées composantes principales, tout en minimisant la perte d’information. Elle ne consiste ni à ajouter une catégorie cible ni à supprimer simplement les variables les plus dispersées.

8. Comment les premières composantes principales sont-elles hiérarchisées dans une ACP ?

Elles sont ordonnées selon la fréquence des catégories, puis selon la proximité des individus
Elles sont choisies selon le nombre minimal de variables initiales, puis les variables qualitatives restantes
Elles sont déterminées par une catégorie cible, puis par la probabilité de chaque observation
Elles sont choisies selon la quantité maximale de variabilité expliquée, puis la variabilité restante

Elles sont choisies selon la quantité maximale de variabilité expliquée, puis la variabilité restante

Explication

La première composante explique la plus grande part possible de la variabilité, puis les composantes suivantes expliquent la variabilité encore disponible. Une ACP ne hiérarchise pas ses composantes selon des catégories cibles ou des fréquences de modalités.

9. Dans un tableau de données comportant nn individus et pp variables quantitatives, que représente une ligne ?

Une corrélation entre deux variables quantitatives
Une moyenne calculée pour l’ensemble des individus
Une variable décrite par ses valeurs individuelles
Un individu décrit par ses valeurs sur les variables

Un individu décrit par ses valeurs sur les variables

Explication

Chaque ligne correspond à un individu, tandis que chaque colonne correspond à une variable quantitative. La description d’une variable par ses valeurs se fait donc dans une colonne, et non dans une ligne.

10. Comment représente-t-on mathématiquement l’individu ii décrit par pp variables quantitatives ?

Par le vecteur xi=(xi1,xi2,…,xip)∈Rnx_i=(x_{i1},x_{i2},\ldots,x_{ip})\in\mathbb{R}^n
Par le vecteur xi=(x1i,x2i,…,xpi)∈Rpx_i=(x_{1i},x_{2i},\ldots,x_{pi})\in\mathbb{R}^p
Par le vecteur xi=(x1i,x2i,…,xni)∈Rnx_i=(x_{1i},x_{2i},\ldots,x_{ni})\in\mathbb{R}^n
Par le vecteur xi=(xi1,xi2,…,xip)∈Rpx_i=(x_{i1},x_{i2},\ldots,x_{ip})\in\mathbb{R}^p

Par le vecteur $$x_i=(x_{i1},x_{i2},\ldots,x_{ip})\in\mathbb{R}^p$$

Explication

L’individu ii est décrit par ses pp valeurs, ce qui forme un vecteur de Rp\mathbb{R}^p. Un vecteur de Rn\mathbb{R}^n correspondrait plutôt aux valeurs d’une variable pour les nn individus.

11. Pour une variable fixée jj, quel vecteur rassemble ses valeurs observées sur les nn individus ?

xj=(x1j,x2j,…,xnj)∈Rnx_j=(x_{1j},x_{2j},\ldots,x_{nj})\in\mathbb{R}^n
xj=(x1j,x2j,…,xnj)∈Rpx_j=(x_{1j},x_{2j},\ldots,x_{nj})\in\mathbb{R}^p
xj=(xj1,xj2,…,xjp)∈Rnx_j=(x_{j1},x_{j2},\ldots,x_{jp})\in\mathbb{R}^n
xj=(xj1,xj2,…,xjp)∈Rpx_j=(x_{j1},x_{j2},\ldots,x_{jp})\in\mathbb{R}^p

$$x_j=(x_{1j},x_{2j},\ldots,x_{nj})\in\mathbb{R}^n$$

Explication

Une variable fixée est observée pour chacun des nn individus et forme donc un vecteur de Rn\mathbb{R}^n. Les indices x1j,…,xnjx_{1j},\ldots,x_{nj} maintiennent la variable jj constante et font varier l’individu.

12. Pour centrer la variable XjX_j, quelle transformation faut-il appliquer à chaque valeur xijx_{ij} ?

Diviser par l’écart-type σj\sigma_j après avoir conservé la moyenne
Ajouter la moyenne xˉj\bar{x}_j afin de déplacer les valeurs
Diviser chaque valeur par le nombre d’individus nn
Soustraire la moyenne xˉj=1n∑i=1nxij\bar{x}_j=\frac{1}{n}\sum_{i=1}^{n}x_{ij}

Soustraire la moyenne $$\bar{x}_j=\frac{1}{n}\sum_{i=1}^{n}x_{ij}$$

Explication

Le centrage consiste à calculer xijc=xij−xˉjx^c_{ij}=x_{ij}-\bar{x}_j, donc à soustraire la moyenne de la variable. Diviser par l’écart-type correspond à l’étape de réduction, et non au centrage seul.

13. Une variable centrée-réduite est-elle obtenue par quelle expression ?

zij=xij−xˉjσjz_{ij}=\frac{x_{ij}-\bar{x}_j}{\sigma_j}
zij=xij−σjxˉjz_{ij}=x_{ij}-\sigma_j\bar{x}_j
zij=xij−σjxˉjz_{ij}=\frac{x_{ij}-\sigma_j}{\bar{x}_j}
zij=xij+xˉjσjz_{ij}=\frac{x_{ij}+\bar{x}_j}{\sigma_j}

$$z_{ij}=\frac{x_{ij}-\bar{x}_j}{\sigma_j}$$

Explication

La standardisation soustrait d’abord la moyenne puis divise par l’écart-type, selon zij=xij−xˉjσjz_{ij}=\frac{x_{ij}-\bar{x}_j}{\sigma_j}. Cette transformation produit une moyenne nulle et une variance égale à 1.

14. Quelle condition caractérise une pondération valide des individus ?

Les poids vérifient ∑i=1npi=1\sum_{i=1}^{n}p_i=1, avec pi=1σjp_i=\frac{1}{\sigma_j} dans le cas équipondéré
Les poids vérifient ∑i=1npi=0\sum_{i=1}^{n}p_i=0, avec pi=1np_i=\frac{1}{n} dans le cas équipondéré
Les poids vérifient ∑i=1npi=1\sum_{i=1}^{n}p_i=1, avec pi=1np_i=\frac{1}{n} dans le cas équipondéré
Les poids vérifient ∑i=1npi=n\sum_{i=1}^{n}p_i=n, avec pi=1np_i=\frac{1}{n} dans le cas équipondéré

Les poids vérifient $$\sum_{i=1}^{n}p_i=1$$, avec $$p_i=\frac{1}{n}$$ dans le cas équipondéré

Explication

Une pondération valide attribue des poids dont la somme vaut 1; l’équipondération donne à chaque individu le poids 1n\frac{1}{n}. La réduction, elle, concerne l’échelle des variables et utilise l’écart-type.

15. Dans quelle situation le centrage-réduction est-il préférable au centrage seul ?

Lorsque chaque variable est représentée par un vecteur de valeurs
Lorsque les individus reçoivent des poids dont la somme vaut 1
Lorsque les variables ont des unités et des échelles comparables
Lorsque les variables ont des échelles ou des dispersions différentes

Lorsque les variables ont des échelles ou des dispersions différentes

Explication

Le centrage-réduction est adapté lorsque les variables diffèrent par leur échelle ou leur dispersion, car il les ramène à une échelle comparable. Le centrage seul convient lorsque les unités et les échelles sont déjà comparables.

16. Quelle propriété caractérise la diagonale de la matrice de corrélation RR ?

Elle est constituée de 1, car chaque variable centrée-réduite est parfaitement corrélée avec elle-même
Elle contient les poids attribués aux différents individus
Elle est constituée de 0, car les variables centrées-réduites ont une moyenne nulle
Elle contient les écarts-types des variables avant leur réduction

Elle est constituée de 1, car chaque variable centrée-réduite est parfaitement corrélée avec elle-même

Explication

La matrice de corrélation regroupe les corrélations entre variables centrées-réduites, et l’autocorrélation de chaque variable vaut 1. Une moyenne nulle n’implique pas une diagonale nulle; elle résulte du centrage.

17. Dans la relation Ruα=λαuαRu_\alpha=\lambda_\alpha u_\alpha, que représente le vecteur propre uαu_\alpha ?

La variabilité expliquée par l’axe principal associé
La moyenne de la variable centrée-réduite associée
La direction de l’axe principal associé
Le poids attribué à l’individu situé sur cet axe

La direction de l’axe principal associé

Explication

Le vecteur propre uαu_\alpha définit la direction de l’axe principal. La valeur propre λα\lambda_\alpha mesure, quant à elle, la variabilité expliquée par cet axe.

18. Comment s’exprime la première composante principale à partir des variables initiales ?

Comme une somme non pondérée C1=X1+X2+⋯+XpC_1=X_1+X_2+\cdots+X_p
Comme un produit des variables C1=X1X2⋯XpC_1=X_1X_2\cdots X_p
Comme une combinaison linéaire C1=a11X1+a12X2+⋯+a1pXpC_1=a_{11}X_1+a_{12}X_2+\cdots+a_{1p}X_p
Comme une différence entre la première et la dernière variable C1=X1−XpC_1=X_1-X_p

Comme une combinaison linéaire $$C_1=a_{11}X_1+a_{12}X_2+\cdots+a_{1p}X_p$$

Explication

La première composante principale est une combinaison linéaire des variables initiales, chaque variable étant affectée d’un coefficient. Elle ne se réduit donc pas nécessairement à une somme simple, à un produit ou à une différence.

19. Dans une ACP centrée-réduite portant sur pp variables, quelle expression donne l’inertie totale ?

I=λ1×λ2×⋯×λpI=\lambda_1\times\lambda_2\times\cdots\times\lambda_p
I=λ1+λ2pI=\frac{\lambda_1+\lambda_2}{p}
I=λ1+λ2+⋯+λp=pI=\lambda_1+\lambda_2+\cdots+\lambda_p=p
I=λ1−λpI=\lambda_1-\lambda_p

$$I=\lambda_1+\lambda_2+\cdots+\lambda_p=p$$

Explication

L’inertie totale est égale à la somme de toutes les valeurs propres et vaut pp dans une ACP centrée-réduite. Le produit des valeurs propres correspond à une autre opération et ne mesure pas l’inertie totale.

20. Une ACP centrée-réduite possède une inertie totale de 55 et l’axe 22 a une valeur propre de 1,51{,}5 ; quelle proportion d’inertie cet axe explique-t-il ?

20 %20\,\%
33,3 %33{,}3\,\%
30 %30\,\%
7,5 %7{,}5\,\%

$$30\,\%$$

Explication

La proportion expliquée se calcule par λ2∑j=1pλj×100=1,55×100=30 %\frac{\lambda_2}{\sum_{j=1}^{p}\lambda_j}\times100=\frac{1{,}5}{5}\times100=30\,\%. La valeur propre doit être divisée par l’inertie totale avant la conversion en pourcentage.

21. Les trois premières valeurs propres sont 44, 22 et 11, pour une inertie totale de 1010 ; quelle est l’inertie cumulée des trois premiers axes ?

30 %30\,\%
70 %70\,\%
40 %40\,\%
17,5 %17{,}5\,\%

$$70\,\%$$

Explication

L’inertie cumulée vaut 4+2+110×100=70 %\frac{4+2+1}{10}\times100=70\,\%. Il faut additionner les valeurs propres des axes considérés avant de les rapporter à l’inertie totale.

22. Dans une ACP centrée-réduite, quelles valeurs propres le critère de Kaiser conduit-il à retenir ?

Celles qui sont inférieures à 11
Celles qui sont supérieures à 11
Celles situées après le changement de pente
Celles dont la somme atteint environ 50 %50\,\%

Celles qui sont supérieures à $$1$$

Explication

Le critère de Kaiser conserve les axes dont la valeur propre est supérieure à 11. La recherche d’un changement de pente correspond plutôt à l’interprétation du diagramme des éboulis.

23. Si le vecteur centré-réduit de l’individu ii est xicx_i^c et que uαu_\alpha est le vecteur propre associé à l’axe α\alpha, comment obtient-on sa coordonnée factorielle ?

Fiα=xic×uα2F_{i\alpha}=x_i^c\times u_\alpha^2
Fiα=xic−uαF_{i\alpha}=x_i^c-u_\alpha
Fiα=xic+uαF_{i\alpha}=x_i^c+u_\alpha
Fiα=xicuαF_{i\alpha}=x_i^c u_\alpha

$$F_{i\alpha}=x_i^c u_\alpha$$

Explication

La coordonnée factorielle est obtenue par le produit du vecteur centré-réduit de l’individu et du vecteur propre : Fiα=xicuαF_{i\alpha}=x_i^c u_\alpha. Une addition, une soustraction ou un carré ne correspondent pas à la projection factorielle définie ici.

24. Quelle formule permet de calculer la distance euclidienne entre deux individus ii et i′i' décrits par pp variables ?

d(i,i′)=∑j=1p(xijxi′j)d(i,i')=\sqrt{\sum_{j=1}^{p}(x_{ij}x_{i'j})}
d(i,i′)=∑j=1p∣xij−xi′j∣pd(i,i')=\frac{\sum_{j=1}^{p}|x_{ij}-x_{i'j}|}{p}
d(i,i′)=∑j=1p(xij−xi′j)2d(i,i')=\sqrt{\sum_{j=1}^{p}(x_{ij}-x_{i'j})^2}
d(i,i′)=∑j=1p(xij+xi′j)2d(i,i')=\sum_{j=1}^{p}(x_{ij}+x_{i'j})^2

$$d(i,i')=\sqrt{\sum_{j=1}^{p}(x_{ij}-x_{i'j})^2}$$

Explication

La distance euclidienne est la racine carrée de la somme des carrés des écarts entre les coordonnées correspondantes. La somme des coordonnées ou leur produit ne mesure pas directement cette distance.

25. Dans une ACP centrée-réduite, que représentent les coordonnées d’une variable sur les axes factoriels ?

Son écart entre les deux premiers axes
Ses corrélations avec les composantes principales
Sa moyenne calculée sur les individus
Sa contribution absolue à l’inertie totale

Ses corrélations avec les composantes principales

Explication

Les coordonnées d’une variable correspondent à ses corrélations avec les composantes principales. Sa contribution indique son importance dans la construction d’un axe, ce qui constitue une information différente.

26. Sur un cercle des corrélations, que suggèrent deux variables représentées par des vecteurs perpendiculaires ?

Elles sont fortement corrélées positivement
Elles ont des contributions identiques aux axes
Elles sont fortement corrélées négativement
Elles sont peu corrélées entre elles

Elles sont peu corrélées entre elles

Explication

Des vecteurs perpendiculaires indiquent une corrélation faible ou proche de zéro entre les variables. Des vecteurs orientés dans le même sens indiqueraient plutôt une corrélation positive, tandis que des vecteurs opposés indiqueraient une corrélation négative.

27. Quelle démarche permet d’interpréter correctement un axe factoriel ?

Additionner les valeurs propres, classer les individus, puis supprimer les variables
Observer les contributions, ignorer les signes, puis nommer l’axe selon sa variance
Comparer les distances, calculer les moyennes, puis retenir l’axe le plus long
Repérer les fortes corrélations, examiner leurs signes, puis synthétiser l’axe

Repérer les fortes corrélations, examiner leurs signes, puis synthétiser l’axe

Explication

L’interprétation repose sur l’identification des variables fortement corrélées, l’examen du signe de ces corrélations et la formulation d’une synthèse. Ignorer les signes empêcherait de distinguer les variables qui évoluent dans des directions opposées.

28. Dans l’exemple scolaire, quelle interprétation est associée aux deux premiers axes factoriels ?

C1 représente le niveau scolaire général et C2 oppose MATH–PHYS à FRAN–ANGL
C1 représente la proximité des individus et C2 mesure la qualité du cercle
C1 oppose MATH–PHYS à FRAN–ANGL et C2 représente le niveau scolaire général
C1 décrit l’inertie totale et C2 correspond à la somme des valeurs propres

C1 représente le niveau scolaire général et C2 oppose MATH–PHYS à FRAN–ANGL

Explication

Dans cet exemple, C1 synthétise le niveau scolaire général, tandis que C2 oppose principalement les matières MATH–PHYS aux matières FRAN–ANGL. Les autres propositions confondent l’interprétation des axes avec des notions de distance ou d’inertie.

29. Dans une ACP, comment calcule-t-on la contribution de l’individu ii à l’axe α\alpha ?

Ctriα=di2Fiα2×100Ctr_{i\alpha}=\frac{d_i^2}{F_{i\alpha}^2}\times100
Ctriα=Fiα2di2×100Ctr_{i\alpha}=\frac{F_{i\alpha}^2}{d_i^2}\times100
Ctriα=Fiα2nλα×100Ctr_{i\alpha}=\frac{F_{i\alpha}^2}{n\lambda_\alpha}\times100
Ctriα=Fiα2λα×100Ctr_{i\alpha}=\frac{F_{i\alpha}^2}{\lambda_\alpha}\times100

$$Ctr_{i\alpha}=\frac{F_{i\alpha}^2}{n\lambda_\alpha}\times100$$

Explication

La contribution d’un individu à un axe se calcule en rapportant le carré de sa coordonnée factorielle à nλαn\lambda_\alpha, puis en multipliant par 100. Le rapport avec di2d_i^2 correspond au cosinus carré, qui mesure la qualité de représentation plutôt que la participation à la construction de l’axe.

30. Un individu possède une coordonnée factorielle Fiα=3F_{i\alpha}=3 sur un axe et une distance à l’origine telle que di2=9d_i^2=9. Quelle est sa qualité de représentation sur cet axe ?

cosiα2=3cos^2_{i\alpha}=3
cosiα2=13cos^2_{i\alpha}=\frac{1}{3}
cosiα2=1cos^2_{i\alpha}=1
cosiα2=6cos^2_{i\alpha}=6

$$cos^2_{i\alpha}=1$$

Explication

La qualité de représentation se calcule par cosiα2=Fiα2di2cos^2_{i\alpha}=\frac{F_{i\alpha}^2}{d_i^2}, soit 99=1\frac{9}{9}=1. La valeur 13\frac{1}{3} résulterait d’un calcul incorrect utilisant la coordonnée non élevée au carré.

31. Quelle succession décrit correctement les principales étapes d’une ACP complète ?

Calculer les vecteurs propres, interpréter les variables, construire le tableau puis sélectionner les individus
Interpréter les axes, calculer les valeurs propres, construire le tableau puis centrer les variables
Construire le tableau, centrer et éventuellement réduire, calculer la matrice puis les axes et interpréter les résultats
Représenter les individus, réduire les variables, choisir les axes puis construire la matrice de covariance

Construire le tableau, centrer et éventuellement réduire, calculer la matrice puis les axes et interpréter les résultats

Explication

Une ACP complète commence par la préparation du tableau et des variables, suivie de la construction de la matrice, du calcul spectral, du choix des axes, des représentations et de leur interprétation. Commencer par l’interprétation ou les représentations inverse l’ordre logique de la méthode.

Révisez avec les flashcards

Mémorisez les réponses avec 57 flashcards sur Analyse en composantes principales.

Qu'est-ce que la statistique descriptive multidimensionnelle étudie simultanément ?

Plusieurs variables.

Quel type de méthodes regroupe la statistique descriptive multidimensionnelle ?

Celles permettant d’étudier plusieurs variables simultanément.

Quelle hypothèse probabiliste les méthodes multidimensionnelles n'exigent-elles pas ?

Aucun modèle probabiliste a priori.

Voir les flashcards →

Approfondir avec la fiche

Consultez la fiche de révision complète sur Analyse en composantes principales.

Voir la fiche →

Cours similaires

Crée tes propres QCM

Importe ton cours et l'IA génère des QCM avec corrections en 30 secondes.

Générateur de QCM