QCM : Fondamentaux du machine learning — 22 questions

Questions et réponses du QCM

1. Quelle définition du machine learning est attribuée à Arthur Samuel ?

Un système qui limite les ordinateurs à l’exécution de calculs prédéterminés
Une méthode qui oblige les ordinateurs à suivre des règles écrites à l’avance
Une technique qui remplace les données d’apprentissage par des instructions humaines
Un domaine qui permet aux ordinateurs d’apprendre sans être explicitement programmés

Un domaine qui permet aux ordinateurs d’apprendre sans être explicitement programmés

Explication

Arthur Samuel décrit le machine learning comme l’étude donnant aux ordinateurs la capacité d’apprendre sans programmation explicite. La programmation de règles écrites à l’avance correspond à une approche traditionnelle, et non à cette définition.

2. Selon Tom Mitchell, dans quelle situation un programme est-il considéré comme apprenant ?

Lorsque son algorithme devient plus complexe après chaque exécution
Lorsque ses données d’entrée augmentent sans qu’une performance soit mesurée
Lorsque sa performance sur une tâche s’améliore avec l’expérience selon une mesure donnée
Lorsque ses résultats restent identiques pour toutes les expériences réalisées

Lorsque sa performance sur une tâche s’améliore avec l’expérience selon une mesure donnée

Explication

Pour Tom Mitchell, l’apprentissage se caractérise par une amélioration de la performance sur une classe de tâches, mesurée par un critère, grâce à l’expérience. L’augmentation de la complexité de l’algorithme ne constitue pas le critère défini.

3. Dans l’exemple du jeu de dames, que représente la mesure de performance P ?

La probabilité de gagner la partie suivante
Le nombre de parties jouées pendant l’entraînement
La liste des adversaires rencontrés pendant les parties
La règle permettant de déplacer chaque pion

La probabilité de gagner la partie suivante

Explication

Dans cet exemple, la performance P correspond à la probabilité de gagner la partie suivante. Le nombre de parties jouées représente l’expérience E, tandis que les règles et les adversaires ne constituent pas la mesure de performance indiquée.

4. Quels éléments une tâche de machine learning nécessite-t-elle pour prédire un résultat ?

Des capteurs, des graphiques et une procédure de validation
Des résultats, des utilisateurs experts et une base de règles
Des données, des variables caractéristiques et un algorithme
Des étiquettes, des règles fixes et une interface graphique

Des données, des variables caractéristiques et un algorithme

Explication

Une tâche de machine learning s’appuie sur des données, des caractéristiques décrivant les entrées et un algorithme qui les traite pour produire une prédiction. Les autres ensembles peuvent être utiles dans certains systèmes, mais ils ne définissent pas les éléments requis ici.

5. Dans un modèle de machine learning, quel rôle joue une caractéristique ?

Elle fournit un facteur d’entrée observé pour produire une prédiction
Elle remplace les données d’entrée par des réponses attendues
Elle applique la méthode de traitement choisie aux facteurs observés
Elle mesure la qualité finale des prédictions obtenues par le modèle

Elle fournit un facteur d’entrée observé pour produire une prédiction

Explication

Une caractéristique est un facteur d’entrée, aussi appelé paramètre ou variable, que la machine observe pour produire une prédiction. L’application d’une méthode de traitement relève du rôle de l’algorithme, qui ne doit pas être confondu avec la caractéristique.

6. Pourquoi la diversité et la qualité des données sont-elles importantes pour un algorithme de machine learning ?

Elles facilitent la découverte de motifs pertinents et peuvent améliorer la prédiction
Elles permettent à un algorithme médiocre de compenser des données peu fiables
Elles rendent inutile le choix d’un algorithme adapté aux données étudiées
Elles garantissent une prédiction correcte même lorsque les données sont limitées

Elles facilitent la découverte de motifs pertinents et peuvent améliorer la prédiction

Explication

Des données diverses facilitent la découverte de motifs pertinents et améliorent généralement la prédiction, tandis que des données médiocres peuvent rendre inefficace un algorithme performant. La qualité des données ne dispense donc pas de choisir un algorithme adapté et ne garantit pas à elle seule des résultats corrects.

7. Quelle distinction oppose correctement l’apprentissage supervisé à l’apprentissage non supervisé ?

Le supervisé recherche des groupes sans étiquettes, tandis que le non supervisé apprend avec des réponses attendues
Le supervisé utilise des données étiquetées, tandis que le non supervisé recherche des motifs sans réponses fournies
Le supervisé traite des données sans variables, tandis que le non supervisé utilise des étiquettes pour chaque exemple
Le supervisé découvre une structure inconnue, tandis que le non supervisé compare ses résultats à un enseignant

Le supervisé utilise des données étiquetées, tandis que le non supervisé recherche des motifs sans réponses fournies

Explication

L’apprentissage supervisé dispose d’étiquettes et de réponses attendues, alors que l’apprentissage non supervisé recherche une structure à partir de données non étiquetées. Les autres propositions inversent ces rôles ou attribuent à l’un des deux paradigmes une caractéristique qui appartient à l’autre.

8. Quel est l’objectif principal de l’apprentissage non supervisé ?

Extraire des structures ou des motifs sans connaître à l’avance les résultats corrects
Améliorer une prédiction en comparant chaque réponse à une étiquette attendue
Appliquer des règles établies par un enseignant à des exemples déjà classés
Mesurer la performance d’un modèle à partir de réponses correctes fournies

Extraire des structures ou des motifs sans connaître à l’avance les résultats corrects

Explication

L’apprentissage non supervisé cherche des structures ou des motifs sans réponses correctes connues à l’avance et sans retour fondé sur la performance de prédiction. La comparaison avec des étiquettes et l’évaluation par réponses attendues caractérisent plutôt l’apprentissage supervisé.

9. Quelle distinction caractérise le mieux la classification par rapport à la régression ?

La classification décrit les entrées, tandis que la régression sélectionne les exemples d’apprentissage.
La classification réduit le nombre de variables, tandis que la régression forme des groupes similaires.
La classification prédit une catégorie discrète, tandis que la régression prédit une valeur continue.
La classification estime une valeur continue, tandis que la régression attribue une catégorie discrète.

La classification prédit une catégorie discrète, tandis que la régression prédit une valeur continue.

Explication

La classification attribue une observation à une catégorie discrète, alors que la régression vise une sortie continue. La confusion la plus fréquente consiste à inverser ces deux types de sorties.

10. Quelle situation constitue une application de la régression ?

Prédire le prix d’une maison à partir de sa superficie.
Attribuer un courriel à la catégorie « indésirable ».
Identifier la classe d’une image parmi plusieurs catégories.
Regrouper des clients selon leurs comportements d’achat.

Prédire le prix d’une maison à partir de sa superficie.

Explication

Le prix d’une maison est une valeur continue estimée à partir d’une variable explicative, ce qui correspond à une régression. Les autres situations concernent une classification ou un regroupement non supervisé.

11. Quel objectif correspond au clustering dans une méthode non supervisée ?

Attribuer chaque observation à une catégorie connue lors de l’apprentissage.
Prédire une variable cible continue à partir de variables d’entrée.
Organiser les observations en groupes selon leur similarité intrinsèque.
Résumer les données avec moins d’informations pour faciliter leur visualisation.

Organiser les observations en groupes selon leur similarité intrinsèque.

Explication

Le clustering recherche des groupes d’observations fortement similaires en exploitant la structure interne des données. La réduction de dimension résume les données, tandis que les deux autres propositions décrivent des tâches supervisées.

12. Quelle méthode vise à représenter des données avec moins d’informations afin de faciliter leur visualisation ?

La réduction de dimension, notamment avec l’analyse en composantes principales.
La régression, notamment avec les machines à vecteurs de support.
Le clustering, notamment avec l’algorithme des k plus proches voisins.
La classification, notamment avec la régression logistique.

La réduction de dimension, notamment avec l’analyse en composantes principales.

Explication

La réduction de dimension diminue le nombre d’informations représentées et peut servir à visualiser ou simplifier les données. Le clustering forme des groupes, tandis que la classification et la régression prédisent des sorties.

13. Dans un exemple d’apprentissage noté (x(i),y(i))\left(x^{(i)}, y^{(i)}\right), que représente y(i)y^{(i)} ?

La fonction de prédiction apprise.
La variable cible à prédire.
Le nombre total d’exemples disponibles.
Le vecteur des variables d’entrée.

La variable cible à prédire.

Explication

Dans un couple d’apprentissage, x(i)x^{(i)} contient les variables d’entrée et y(i)y^{(i)} représente la cible associée. La fonction de prédiction est notée hh, tandis que le nombre d’exemples est noté mm.

14. Comment définit-on un ensemble d’apprentissage contenant mm exemples ?

Une liste de couples (x(i),y(i))\left(x^{(i)}, y^{(i)}\right) pour ii allant de 11 à mm.
Une fonction hh qui transforme chaque entrée xx en une sortie prédite.
Une seule paire de variables utilisée pour représenter toutes les observations.
Une liste de catégories discrètes sans variables d’entrée associées.

Une liste de couples $$\left(x^{(i)}, y^{(i)}\right)$$ pour $$i$$ allant de $$1$$ à $$m$$.

Explication

Un ensemble d’apprentissage rassemble mm exemples, chacun étant un couple (x(i),y(i))\left(x^{(i)}, y^{(i)}\right) indexé de 11 à mm. La fonction hh est l’hypothèse apprise à partir de cet ensemble et ne constitue pas l’ensemble lui-même.

15. Quel rôle joue l’hypothèse hh dans un modèle d’apprentissage ?

Elle réduit les données à un nombre inférieur de dimensions pour les visualiser.
Elle associe une entrée de l’espace XX à une sortie de l’espace YY pour prédire la cible.
Elle organise les observations en groupes selon leurs ressemblances.
Elle rassemble les mm couples d’exemples utilisés pendant l’apprentissage.

Elle associe une entrée de l’espace $$X$$ à une sortie de l’espace $$Y$$ pour prédire la cible.

Explication

L’hypothèse hh est une fonction apprise qui transforme une entrée xx en une prédiction de la sortie yy. L’ensemble de couples sert à apprendre cette fonction, tandis que les deux dernières propositions décrivent des méthodes non supervisées.

16. Dans le modèle de régression linéaire simple hθ(x)=θ0+θ1xh_{\theta}(x)=\theta_0+\theta_1x, quel rôle joue θ1\theta_1 ?

Il représente l’ordonnée à l’origine
Il représente la pente de la droite
Il mesure l’erreur moyenne des prédictions
Il indique le nombre d’exemples utilisés

Il représente la pente de la droite

Explication

Dans ce modèle, θ1\theta_1 contrôle la variation de la prédiction lorsque xx augmente d’une unité, ce qui en fait la pente. θ0\theta_0 correspond plutôt à l’ordonnée à l’origine, et non à la pente.

17. Quelle expression représente la fonction de coût des moindres carrés pour un modèle de régression linéaire comportant mm exemples ?

J(θ)=12m∑i=1m(hθ(x(i))−y(i))J(\boldsymbol{\theta})=\frac{1}{2m}\sum_{i=1}^{m}\left(h_{\boldsymbol{\theta}}(x^{(i)})-y^{(i)}\right)
J(θ)=1m∑i=1m(hθ(x(i))+y(i))2J(\boldsymbol{\theta})=\frac{1}{m}\sum_{i=1}^{m}\left(h_{\boldsymbol{\theta}}(x^{(i)})+y^{(i)}\right)^2
J(θ)=12∑i=1m(hθ(x(i))−y(i))2J(\boldsymbol{\theta})=\frac{1}{2}\sum_{i=1}^{m}\left(h_{\boldsymbol{\theta}}(x^{(i)})-y^{(i)}\right)^2
J(θ)=12m∑i=1m(hθ(x(i))−y(i))2J(\boldsymbol{\theta})=\frac{1}{2m}\sum_{i=1}^{m}\left(h_{\boldsymbol{\theta}}(x^{(i)})-y^{(i)}\right)^2

$$J(\boldsymbol{\theta})=\frac{1}{2m}\sum_{i=1}^{m}\left(h_{\boldsymbol{\theta}}(x^{(i)})-y^{(i)}\right)^2$$

Explication

La fonction de coût des moindres carrés calcule la moyenne des erreurs au carré, avec le facteur 12m\frac{1}{2m}. L’hypothèse fournit les prédictions, tandis que la fonction de coût quantifie leur écart moyen aux valeurs observées.

18. Lors de l’apprentissage d’une régression linéaire, quel choix des paramètres est recherché ?

Des paramètres qui maximisent la pente de la droite
Des paramètres qui rendent toutes les prédictions identiques
Des paramètres qui augmentent l’écart aux valeurs observées
Des paramètres qui minimisent la fonction de coût

Des paramètres qui minimisent la fonction de coût

Explication

L’apprentissage cherche les valeurs de θ0\theta_0 et θ1\theta_1 qui réduisent la fonction de coût et rapprochent les prédictions des observations. Maximiser la pente ou augmenter les écarts ne correspond pas à cet objectif.

19. Dans quelle direction les paramètres sont-ils modifiés pendant la descente de gradient ?

Dans la direction perpendiculaire à la pente locale
Dans une direction choisie au hasard à chaque étape
Dans la direction du gradient sans inversion
Dans la direction opposée au gradient

Dans la direction opposée au gradient

Explication

La descente de gradient soustrait une quantité proportionnelle au gradient, ce qui déplace les paramètres vers une diminution de la fonction de coût. Suivre directement le gradient conduirait généralement vers une augmentation locale du coût.

20. Quelle mise à jour correspond à la descente de gradient pour le paramètre θj\theta_j, avec j∈{0,1}j\in\{0,1\} ?

θj:=αθj−∂∂θjJ(θ0,θ1)\theta_j:=\alpha\theta_j-\frac{\partial}{\partial\theta_j}J(\theta_0,\theta_1)
θj:=θj+α∂∂θjJ(θ0,θ1)\theta_j:=\theta_j+\alpha\frac{\partial}{\partial\theta_j}J(\theta_0,\theta_1)
θj:=θj−α∂∂θjJ(θ0,θ1)\theta_j:=\theta_j-\alpha\frac{\partial}{\partial\theta_j}J(\theta_0,\theta_1)
θj:=θj−1α∂∂θjJ(θ0,θ1)\theta_j:=\theta_j-\frac{1}{\alpha}\frac{\partial}{\partial\theta_j}J(\theta_0,\theta_1)

$$\theta_j:=\theta_j-\alpha\frac{\partial}{\partial\theta_j}J(\theta_0,\theta_1)$$

Explication

La règle soustrait le gradient partiel multiplié par le taux d’apprentissage α\alpha au paramètre courant. Le signe plus inverserait la direction de déplacement, tandis que les deux autres expressions utilisent incorrectement α\alpha.

21. Quel effet produit généralement un taux d’apprentissage α\alpha trop petit dans la descente de gradient ?

Le gradient change automatiquement de signe
La convergence devient très lente
Le minimum est dépassé à chaque mise à jour
Tous les paramètres deviennent nuls

La convergence devient très lente

Explication

Un taux d’apprentissage trop petit entraîne des déplacements faibles, de sorte que l’algorithme progresse lentement vers le minimum. Le dépassement du minimum est plutôt associé à un taux trop grand.

22. Quelle distinction décrit correctement les variantes de la descente de gradient selon le nombre d’exemples utilisés par mise à jour ?

Le batch utilise un sous-ensemble de taille kk, le stochastique tous les exemples et le mini-lot un seul
Le batch utilise tous les exemples, le stochastique un seul et le mini-lot un sous-ensemble de taille kk
Le batch et le stochastique utilisent tous les exemples, tandis que le mini-lot en utilise un seul
Le batch utilise un exemple, le stochastique tous les exemples et le mini-lot deux exemples

Le batch utilise tous les exemples, le stochastique un seul et le mini-lot un sous-ensemble de taille $$k$$

Explication

La méthode par lots calcule chaque mise à jour avec l’ensemble des exemples, la méthode stochastique avec un seul, et la méthode par mini-lots avec kk exemples. Confondre le batch et le stochastique revient à inverser leurs tailles de sous-ensemble.

Révisez avec les flashcards

Mémorisez les réponses avec 45 flashcards sur Fondamentaux du machine learning.

Comment Arthur Samuel définit-il le machine learning ?

Le machine learning est l'étude donnant aux ordinateurs la capacité d'apprendre sans programmation explicite.

Selon Tom Mitchell, quand un programme apprend-il ?

Quand sa performance sur une tâche s'améliore avec l'expérience selon une mesure donnée.

Que représente l'expérience E dans le jeu de dames ?

De nombreuses parties jouées.

Voir les flashcards →

Approfondir avec la fiche

Consultez la fiche de révision complète sur Fondamentaux du machine learning.

Voir la fiche →

Cours similaires

Crée tes propres QCM

Importe ton cours et l'IA génère des QCM avec corrections en 30 secondes.

Générateur de QCM