QCM : Introduction au machine learning — 23 questions

Questions et réponses du QCM

1. Pour identifier une personne à partir de son image, quelle tâche de machine learning consiste à associer l’entrée à une catégorie ?

La régression
La classification
Le débruitage
La retranscription

La classification

Explication

La classification attribue une entrée à une catégorie, comme l’identité d’une personne représentée sur une image. La régression serait adaptée à la prédiction d’une valeur numérique, et non à celle d’une catégorie.

2. À partir de paramètres météorologiques, quelle tâche permet d’estimer la température dans 24 heures ?

La régression
La détection d’anomalie
La classification
La synthèse

La régression

Explication

La régression associe une entrée à une valeur numérique, telle qu’une température future. La classification produirait une catégorie, ce qui ne correspond pas à cette estimation.

3. Laquelle de ces propositions regroupe exclusivement des tâches présentées en plus de la classification et de la régression ?

La retranscription, la traduction, la détection d’anomalie, la synthèse et le débruitage
La reconnaissance, l’optimisation, le tri, la génération et la planification
La calibration, la navigation, l’assemblage, la prédiction et la commande
La segmentation, le contrôle, la compression, la simulation et la localisation

La retranscription, la traduction, la détection d’anomalie, la synthèse et le débruitage

Explication

Les autres tâches citées sont la retranscription, la traduction, la détection d’anomalie, la synthèse et le débruitage. Les autres listes regroupent des notions qui ne correspondent pas à l’ensemble présenté.

4. Quelle différence caractérise la robotique traditionnelle par rapport à un véhicule autonome ?

Elle reproduit une tâche avec un automate peu adaptatif, tandis que le véhicule autonome réagit à son environnement.
Elle apprend des comportements complexes, tandis que le véhicule autonome répète une séquence prédéfinie.
Elle collabore avec les usagers, tandis que le véhicule autonome fonctionne avec un automate peu adaptatif.
Elle interprète l’environnement, tandis que le véhicule autonome exécute une tâche sans adaptation.

Elle reproduit une tâche avec un automate peu adaptatif, tandis que le véhicule autonome réagit à son environnement.

Explication

La robotique traditionnelle repose sur un automate peu adaptatif, alors qu’un véhicule autonome collabore avec son environnement et les autres usagers. L’idée selon laquelle le véhicule autonome répète une séquence fixe inverse cette distinction.

5. Dans une application robotique, quelle fonction relève de l’intelligence artificielle ?

Peindre les surfaces, emballer les composants et transporter les outils
Alimenter les moteurs, refroidir les circuits et charger les batteries
Percevoir l’environnement, prédire le futur et planifier des actions
Fabriquer les pièces mécaniques, choisir les matériaux et assembler le châssis

Percevoir l’environnement, prédire le futur et planifier des actions

Explication

En robotique, l’intelligence sert notamment à percevoir l’environnement, anticiper le futur et planifier des actions, ainsi qu’à interpréter les comportements et générer des mouvements. Les autres propositions décrivent des opérations matérielles ou logistiques plutôt que des fonctions d’intelligence.

6. Que désigne le codage d’un exemple en apprentissage automatique ?

Sa représentation par un vecteur numérique de caractéristiques
La transformation de sa sortie en une phrase descriptive
La suppression de toutes ses variations dues au bruit
Son association directe avec une catégorie prédéfinie

Sa représentation par un vecteur numérique de caractéristiques

Explication

Le codage, aussi appelé vecteur de caractéristiques, représente chaque exemple par un vecteur numérique. Une catégorie correspond à la classe de l’exemple et ne constitue pas son codage.

7. Pour représenter un poisson en dimension 2, quelles caractéristiques sont considérées ensemble ?

Sa classe et son étiquette
Son image et sa traduction
Son poids et sa catégorie
Sa taille et sa teinte

Sa taille et sa teinte

Explication

Dans cet exemple, la représentation en dimension 2 utilise simultanément la taille et la teinte du poisson. La classe indique une catégorie et ne constitue pas l’une des deux caractéristiques de cette représentation.

8. Quelle propriété décrit un bon codage des données ?

Un fort pouvoir discriminant, une faible variation intra-classe et une bonne stabilité au bruit
Un faible pouvoir discriminant, une forte variation intra-classe et une grande sensibilité au bruit
Un grand nombre de dimensions, une variation élevée et une dépendance aux perturbations
Une représentation identique entre les classes, une dimension élevée et une stabilité limitée

Un fort pouvoir discriminant, une faible variation intra-classe et une bonne stabilité au bruit

Explication

Un bon codage distingue fortement les classes, varie peu à l’intérieur d’une même classe, résiste au bruit et conserve une faible dimension. La deuxième proposition décrit précisément des propriétés défavorables pour un codage fiable.

9. Quelle conséquence une augmentation du nombre de dimensions peut-elle avoir sur la complexité algorithmique d’une méthode de classification ?

Elle ramène la complexité vers une forme linéaire indépendante des données.
Elle peut faire passer la complexité à une forme polynomiale élevée ou exponentielle.
Elle transforme systématiquement la complexité en une fonction logarithmique.
Elle rend la complexité constante lorsque les classes restent inchangées.

Elle peut faire passer la complexité à une forme polynomiale élevée ou exponentielle.

Explication

Une dimension élevée peut conduire à des complexités comme f(n2)f(n^2), f(n3)f(n^3) ou même exponentielles. L’idée qu’une dimension élevée simplifie les calculs confond l’effet de la dimension avec celui d’un problème de faible dimension.

10. Si chaque dimension est divisée en deux régions et qu’il faut deux exemples par région, combien d’exemples sont nécessaires pour couvrir un espace de 20 dimensions ?

1 048 576 exemples
40 exemples
2 097 152 exemples
1 024 exemples

1 048 576 exemples

Explication

Le nombre requis est 2n2^n, donc 220=1 048 5762^{20}=1\,048\,576 exemples. Une multiplication linéaire par le nombre de dimensions, comme 2×202\times20, ne représente pas la croissance combinatoire des régions.

11. Quelle propriété décrit correctement la matrice de covariance de données de dimension nn ?

Elle est diagonale et sa taille est N×NN\times N.
Elle est rectangulaire et sa taille est N×nN\times n.
Elle est symétrique et sa taille est n×nn\times n.
Elle est antisymétrique et sa taille est n×Nn\times N.

Elle est symétrique et sa taille est $$n\times n$$.

Explication

La matrice de covariance possède une structure symétrique et une dimension n×nn\times n; ses valeurs caractérisent la forme du nuage de points. La taille de la base de données, N×nN\times n, ne détermine pas directement la taille de cette matrice.

12. Quel est l’objectif principal de l’analyse en composantes principales ?

Remplacer chaque dimension par une caractéristique choisie parmi les variables initiales.
Augmenter la dimension des données pour séparer plus facilement les classes.
Conserver les dimensions initiales tout en supprimant les exemples redondants.
Projeter les données dans une dimension plus faible en conservant autant d’information que possible.

Projeter les données dans une dimension plus faible en conservant autant d’information que possible.

Explication

L’ACP construit une projection vers une dimension inférieure qui préserve autant d’information que possible. La sélection de caractéristiques conserve des dimensions initiales, tandis que l’ACP crée de nouveaux axes.

13. Quelles opérations sont effectuées pour standardiser les données avant une ACP ?

Classer les exemples puis supprimer les dimensions de faible variance.
Centrer chaque dimension puis diviser ses valeurs par son écart-type.
Projeter les données puis centrer les coordonnées obtenues.
Diviser chaque dimension par sa moyenne puis ajouter son écart-type.

Centrer chaque dimension puis diviser ses valeurs par son écart-type.

Explication

La standardisation consiste à centrer chaque dimension, ce qui donne une moyenne nulle, puis à diviser par son écart-type, ce qui donne un écart-type égal à un. Centrer et normaliser sont donc deux opérations distinctes et successives.

14. Comment choisit-on le premier axe principal à partir de la matrice de covariance ?

Comme le vecteur propre associé à la plus petite valeur propre.
Comme le vecteur moyen de l’ensemble des observations.
Comme l’axe coordonné présentant la plus faible variance.
Comme le vecteur propre associé à la plus grande valeur propre.

Comme le vecteur propre associé à la plus grande valeur propre.

Explication

Le premier axe principal est le vecteur propre correspondant à la plus grande valeur propre de la matrice de covariance, car il maximise la variance projetée. La plus petite valeur propre correspond à une direction de variance faible et ne définit pas le premier axe.

15. Comment calcule-t-on la proportion d’inertie conservée par les dd premiers axes principaux ?

dn(λ1+λ2+⋯+λn)\frac{d}{n}\left(\lambda_1+\lambda_2+\cdots+\lambda_n\right)
λ1+λ2+⋯+λdλ1+λ2+⋯+λn\frac{\lambda_1+\lambda_2+\cdots+\lambda_d}{\lambda_1+\lambda_2+\cdots+\lambda_n}
λ1+λ2+⋯+λnλ1+λ2+⋯+λd\frac{\lambda_1+\lambda_2+\cdots+\lambda_n}{\lambda_1+\lambda_2+\cdots+\lambda_d}
λdλ1+λ2+⋯+λn\frac{\lambda_d}{\lambda_1+\lambda_2+\cdots+\lambda_n}

$$\frac{\lambda_1+\lambda_2+\cdots+\lambda_d}{\lambda_1+\lambda_2+\cdots+\lambda_n}$$

Explication

La proportion d’inertie conservée est la somme des dd premières valeurs propres divisée par la somme de toutes les valeurs propres. Utiliser uniquement λd\lambda_d néglige les contributions des axes précédents.

16. Quel objectif distingue principalement l’analyse discriminante linéaire de l’analyse en composantes principales ?

Maximiser le rapport entre la variance inter-classe et la variance intra-classe
Maximiser la variance globale sans tenir compte des classes
Réduire le nombre de variables selon leur variance individuelle
Minimiser la distance entre les centres de toutes les classes

Maximiser le rapport entre la variance inter-classe et la variance intra-classe

Explication

La LDA cherche des directions qui séparent les classes en maximisant le rapport entre variance inter-classe et variance intra-classe. L’ACP vise plutôt à maximiser la variance globale, sans utiliser explicitement les étiquettes de classe.

17. Deux classes ont des covariances Σ1\Sigma_1 et Σ2\Sigma_2, ainsi que des proportions p1p_1 et p2p_2. Quelle expression représente leur covariance intra-classe ?

Σintra=p1Σ1+p2Σ2\Sigma_{intra}=p_1\Sigma_1+p_2\Sigma_2
Σintra=p1(μ1−μ)(μ1−μ)T+p2(μ2−μ)(μ2−μ)T\Sigma_{intra}=p_1(\mu_1-\mu)(\mu_1-\mu)^T+p_2(\mu_2-\mu)(\mu_2-\mu)^T
Σintra=Σ1+Σ2+(μ1−μ2)(μ1−μ2)T\Sigma_{intra}=\Sigma_1+\Sigma_2+(\mu_1-\mu_2)(\mu_1-\mu_2)^T
Σintra=p1Σ2+p2Σ1\Sigma_{intra}=p_1\Sigma_2+p_2\Sigma_1

$$\Sigma_{intra}=p_1\Sigma_1+p_2\Sigma_2$$

Explication

La covariance intra-classe est la moyenne pondérée des covariances propres aux classes, avec les proportions comme poids. L’expression fondée sur les écarts entre moyennes décrit la dispersion inter-classe plutôt que la dispersion interne.

18. Dans l’analyse discriminante linéaire, quelle quantité mesure l’éloignement pondéré des moyennes de classe par rapport à la moyenne globale ?

Σinter=∑k=1KpkΣk\Sigma_{inter}=\sum_{k=1}^{K}p_k\Sigma_k
Σinter=∑k=1K(μk−μk)(μk−μk)T\Sigma_{inter}=\sum_{k=1}^{K}(\mu_k-\mu_k)(\mu_k-\mu_k)^T
Σinter=∑k=1Kpk(μk+μ)(μk+μ)T\Sigma_{inter}=\sum_{k=1}^{K}p_k(\mu_k+\mu)(\mu_k+\mu)^T
Σinter=∑k=1Kpk(μk−μ)(μk−μ)T\Sigma_{inter}=\sum_{k=1}^{K}p_k(\mu_k-\mu)(\mu_k-\mu)^T

$$\Sigma_{inter}=\sum_{k=1}^{K}p_k(\mu_k-\mu)(\mu_k-\mu)^T$$

Explication

La covariance inter-classe additionne les produits externes des écarts entre chaque moyenne de classe et la moyenne globale, pondérés par les proportions. La somme pondérée des matrices Σk\Sigma_k correspond à la covariance intra-classe.

19. Après calcul de Σintra−1Σinter\Sigma_{intra}^{-1}\Sigma_{inter}, comment les axes de la LDA sont-ils déterminés ?

Comme les moyennes de classe classées selon leur norme
Comme les variables initiales classées selon leur variance globale
Comme les vecteurs propres associés aux valeurs propres croissantes
Comme les vecteurs propres associés aux valeurs propres décroissantes

Comme les vecteurs propres associés aux valeurs propres décroissantes

Explication

Les axes LDA sont les vecteurs propres de Σintra−1Σinter\Sigma_{intra}^{-1}\Sigma_{inter}, ordonnés selon des valeurs propres décroissantes. Les moyennes et les variances globales ne définissent pas directement ces axes.

20. Quelle différence décrit correctement la projection et la sélection de caractéristiques ?

La projection construit des combinaisons linéaires, tandis que la sélection conserve certaines dimensions initiales
La projection évalue un classifieur, tandis que la sélection calcule une covariance inter-classe
La projection choisit des variables selon leur corrélation, tandis que la sélection maximise la variance globale
La projection conserve des variables initiales, tandis que la sélection construit des combinaisons linéaires

La projection construit des combinaisons linéaires, tandis que la sélection conserve certaines dimensions initiales

Explication

La réduction par projection transforme les variables en nouvelles dimensions obtenues par combinaison linéaire. La sélection réduit l’espace en gardant certaines caractéristiques originales sans les combiner.

21. Comment fonctionnent les méthodes filter pour réduire un ensemble de nn caractéristiques ?

Elles sélectionnent en amont des caractéristiques selon un critère, afin d’obtenir un sous-ensemble de taille d≪nd\ll n
Elles combinent les variables dans de nouvelles dimensions avant l’apprentissage
Elles entraînent plusieurs classifieurs et gardent le sous-ensemble donnant la meilleure précision
Elles ajoutent progressivement les variables selon leur amélioration du modèle courant

Elles sélectionnent en amont des caractéristiques selon un critère, afin d’obtenir un sous-ensemble de taille $$d\ll n$$

Explication

Les méthodes filter évaluent les caractéristiques avant la classification à l’aide d’un critère et retiennent un nombre réduit dd par rapport à nn. L’évaluation directe de la performance d’un classifieur caractérise plutôt les méthodes wrapper.

22. Sur quel principe repose une méthode wrapper de sélection de caractéristiques ?

Projeter les variables dans un espace de dimension inférieure
Évaluer chaque sous-ensemble selon la performance d’un algorithme de classification
Conserver les caractéristiques présentant la plus grande variance marginale
Classer les caractéristiques selon une mesure indépendante du classifieur

Évaluer chaque sous-ensemble selon la performance d’un algorithme de classification

Explication

Une méthode wrapper teste des sous-ensembles en fonction de leurs performances avec un algorithme d’apprentissage. Une méthode filter utilise plutôt un critère de sélection indépendant de la performance du classifieur.

23. Quelle comparaison entre les méthodes filter et wrapper est correcte ?

Les filter optimisent directement le classifieur, tandis que les wrapper ignorent les performances de classification
Les filter et les wrapper ont un coût similaire, mais les filter utilisent toujours davantage de caractéristiques
Les filter sont coûteuses mais modélisent les interactions, tandis que les wrapper sont rapides et indépendantes du classifieur
Les filter sont rapides mais négligent les interactions, tandis que les wrapper sont coûteuses mais peuvent trouver de petits sous-ensembles performants

Les filter sont rapides mais négligent les interactions, tandis que les wrapper sont coûteuses mais peuvent trouver de petits sous-ensembles performants

Explication

Les méthodes filter sont efficaces en calcul, mais elles ne prennent pas en compte les interactions entre caractéristiques ni la performance du classifieur. Les méthodes wrapper peuvent sélectionner de petits sous-ensembles performants, au prix d’un coût de calcul élevé.

Révisez avec les flashcards

Mémorisez les réponses avec 41 flashcards sur Introduction au machine learning.

Qu'est-ce que la classification en machine learning ?

Associer une entrée à une catégorie.

Qu'impose la régression en machine learning ?

Associer une entrée à une valeur numérique.

Quelles tâches autres que classification et régression sont présentées ?

Retranscription, traduction, détection d’anomalie, synthèse et débruitage.

Voir les flashcards →

Approfondir avec la fiche

Consultez la fiche de révision complète sur Introduction au machine learning.

Voir la fiche →

Cours similaires

Crée tes propres QCM

Importe ton cours et l'IA génère des QCM avec corrections en 30 secondes.

Générateur de QCM