QCM : Bases des réseaux de neurones — 22 questions

Questions et réponses du QCM

1. Quel calcul une unité logique à seuil applique-t-elle à ses entrées ?

Elle choisit l’entrée de plus grande valeur pour produire sa sortie
Elle compare une somme pondérée, décalée par un biais, à zéro
Elle transforme chaque entrée séparément avant de les additionner
Elle calcule une moyenne des entrées sans paramètre de seuil

Elle compare une somme pondérée, décalée par un biais, à zéro

Explication

L’unité calcule une somme pondérée puis ajoute un biais avant d’appliquer un seuil à zéro. Le biais ne sert donc pas à moyenner les entrées, mais à déplacer le seuil de décision.

2. Quelle expression réalise une porte AND avec une unité logique à seuil pour des entrées binaires ?

1{x1−x2+1.5≥0}\mathbf{1}\{x_1-x_2+1.5\geq0\}
1{x1+x2−0.5≥0}\mathbf{1}\{x_1+x_2-0.5\geq0\}
1{−x1+0.5≥0}\mathbf{1}\{-x_1+0.5\geq0\}
1{x1+x2−1.5≥0}\mathbf{1}\{x_1+x_2-1.5\geq0\}

$$\mathbf{1}\{x_1+x_2-1.5\geq0\}$$

Explication

La porte AND exige que les deux entrées valent 1, ce qui est obtenu avec un seuil de 1,5 appliqué à leur somme. Le seuil de 0,5 correspond à la porte OR, qui s’active dès qu’une entrée vaut 1.

3. Quelle affirmation distingue correctement les fonctions booléennes séparables linéairement de XOR ?

AND, OR et XOR sont réalisables par une seule TLU
OR nécessite plusieurs TLU, tandis que XOR en utilise une seule
XOR est réalisable par une TLU, tandis qu'AND ne l’est pas
AND et OR sont réalisables par une TLU, tandis que XOR ne l’est pas

AND et OR sont réalisables par une TLU, tandis que XOR ne l’est pas

Explication

Une seule TLU peut réaliser une fonction booléenne linéairement séparable, comme AND ou OR, mais pas XOR. La difficulté de XOR vient de l’impossibilité de séparer ses classes par une unique frontière linéaire.

4. Quelle caractéristique distingue le perceptron d’une unité logique à seuil élémentaire ?

Le perceptron fixe ses poids avant d’observer les données
Le perceptron apprend ses poids à partir des données
Le perceptron accepte uniquement des entrées binaires
Le perceptron remplace le seuil par une fonction sigmoïde

Le perceptron apprend ses poids à partir des données

Explication

Le perceptron est une unité à seuil dont les poids sont ajustés à partir d’exemples et dont les entrées peuvent être réelles. Une TLU élémentaire peut au contraire recevoir des poids choisis manuellement pour implémenter une porte logique.

5. Pour quelle valeur de wTx+bw^Tx+b la règle du perceptron produit-elle la sortie 1 ?

Lorsque wTx+b<0w^Tx+b<0
Lorsque wTx+b=1w^Tx+b=1
Lorsque wTx+b≥0w^Tx+b\geq0
Lorsque wTx+b≤−1w^Tx+b\leq-1

Lorsque $$w^Tx+b\geq0$$

Explication

La règle du perceptron utilise la fonction signe, qui renvoie 1 lorsque le score est supérieur ou égal à zéro. Un score négatif conduit à la classe 0, et non à la classe 1.

6. Quelle frontière géométrique définit un classifieur linéaire dans l’espace des entrées ?

La droite définie par wTx−b=1w^Tx-b=1
La courbe définie par σ(wTx+b)=0.5\sigma(w^Tx+b)=0.5
La sphère définie par ∥x∥2+b=0\lVert x\rVert^2+b=0
L’hyperplan défini par wTx+b=0w^Tx+b=0

L’hyperplan défini par $$w^Tx+b=0$$

Explication

La séparation entre les classes est donnée par l’ensemble des points dont le score linéaire est nul, soit l’hyperplan wTx+b=0w^Tx+b=0. La sigmoïde peut représenter une probabilité, mais ce n’est pas elle qui change la définition de la frontière linéaire.

7. Quelles hypothèses caractérisent l’analyse discriminante linéaire pour les populations de classes ?

Elles sont gaussiennes et partagent une même matrice de covariance
Elles suivent une loi sigmoïde et partagent une même moyenne
Elles sont non paramétriques et présentent des variances indépendantes
Elles sont uniformes et possèdent des matrices de covariance distinctes

Elles sont gaussiennes et partagent une même matrice de covariance

Explication

L’analyse discriminante linéaire suppose des populations gaussiennes ayant une matrice de covariance commune, propriété appelée homoscédasticité. La régression logistique ne repose pas sur ces hypothèses distributionnelles concernant les prédicteurs.

8. Quel rôle joue la fonction σ(x)=11+exp⁡(−x)\sigma(x)=\frac{1}{1+\exp(-x)} dans la régression logistique ?

Elle transforme une probabilité bornée en score linéaire pouvant prendre toute valeur
Elle convertit un score linéaire non borné en valeur interprétable comme probabilité
Elle remplace la vraisemblance par une règle de vote entre les classes
Elle sépare directement les observations par plusieurs hyperplans indépendants

Elle convertit un score linéaire non borné en valeur interprétable comme probabilité

Explication

La sigmoïde comprime un score linéaire, qui peut être quelconque, dans l’intervalle des probabilités. Elle ne construit pas plusieurs frontières ni ne remplace l’optimisation de la vraisemblance par un vote.

9. Sous les hypothèses de l’analyse discriminante linéaire, comment s’exprime la probabilité postérieure de la classe 1 ?

P(Y=1∣x)=wTx+bP(Y=1\mid x)=w^Tx+b
P(Y=1∣x)=σ(wTx+b)P(Y=1\mid x)=\sigma(w^Tx+b)
P(Y=1∣x)=exp⁡(wTx+b)P(Y=1\mid x)=\exp(w^Tx+b)
P(Y=1∣x)=1wTx+bP(Y=1\mid x)=\frac{1}{w^Tx+b}

$$P(Y=1\mid x)=\sigma(w^Tx+b)$$

Explication

Sous ces hypothèses, la probabilité postérieure s’écrit comme la sigmoïde appliquée au score linéaire wTx+bw^Tx+b. Le score linéaire seul n’est pas borné et ne peut donc pas être interprété directement comme une probabilité.

10. Quelle fonction objectif la régression logistique minimise-t-elle lorsqu’elle maximise la vraisemblance ?

La variance commune estimée dans chaque population de classe
La somme des erreurs absolues entre les scores et les étiquettes
La somme des distances euclidiennes entre les classes prédites
La perte d’entropie croisée associée aux probabilités prédites

La perte d’entropie croisée associée aux probabilités prédites

Explication

Maximiser la vraisemblance en régression logistique revient à minimiser la perte d’entropie croisée construite à partir des sorties sigmoïdes. La variance commune appartient aux hypothèses de l’analyse discriminante linéaire et ne constitue pas cette fonction objectif.

11. Quelle distinction décrit correctement une dérivée partielle et un gradient pour une fonction de plusieurs variables ?

La dérivée partielle mesure une variation temporelle, tandis que le gradient mesure une valeur moyenne.
La dérivée partielle concerne une variable, tandis que le gradient rassemble toutes les dérivées partielles.
La dérivée partielle donne une direction de croissance, tandis que le gradient donne une valeur de sortie.
La dérivée partielle rassemble toutes les variables, tandis que le gradient concerne une seule variable.

La dérivée partielle concerne une variable, tandis que le gradient rassemble toutes les dérivées partielles.

Explication

Une dérivée partielle décrit la variation selon une variable en maintenant les autres paramètres dans le cadre considéré, alors que le gradient regroupe toutes ces dérivées. Confondre le gradient avec une seule dérivée partielle revient à négliger les autres directions d’entrée.

12. Une fonction dépend de plusieurs fonctions intermédiaires gi(x)g_i(x). Quelle expression permet de calculer sa dérivée par rapport à xx ?

dfdx=∑i∂f∂x∂gi∂gi\frac{df}{dx}=\sum_i\frac{\partial f}{\partial x}\frac{\partial g_i}{\partial g_i}
dfdx=∂f∂gi+∂gi∂x\frac{df}{dx}=\frac{\partial f}{\partial g_i}+\frac{\partial g_i}{\partial x}
dfdx=∏i∂f∂gi+∂gi∂x\frac{df}{dx}=\prod_i\frac{\partial f}{\partial g_i}+\frac{\partial g_i}{\partial x}
dfdx=∑i∂f∂gi∂gi∂x\frac{df}{dx}=\sum_i\frac{\partial f}{\partial g_i}\frac{\partial g_i}{\partial x}

$$\frac{df}{dx}=\sum_i\frac{\partial f}{\partial g_i}\frac{\partial g_i}{\partial x}$$

Explication

La règle de chaîne additionne, pour chaque fonction intermédiaire, le produit de la dérivée de la sortie par rapport à cette intermédiaire et de la dérivée de cette intermédiaire par rapport à l’entrée. Une simple addition ou un produit global ne représente pas cette composition des dépendances.

13. Quelle mise à jour applique la descente de gradient aux paramètres θ\theta pour réduire une fonction de perte LL ?

θt+1=θt+γ∇θL(θt)\theta_{t+1}=\theta_t+\gamma\nabla_\theta L(\theta_t)
θt+1=θt−∇θL(γθt)\theta_{t+1}=\theta_t-\nabla_\theta L(\gamma\theta_t)
θt+1=θt−γ∇θL(θt)\theta_{t+1}=\theta_t-\gamma\nabla_\theta L(\theta_t)
θt+1=γθt−∇θL(θt)\theta_{t+1}=\gamma\theta_t-\nabla_\theta L(\theta_t)

$$\theta_{t+1}=\theta_t-\gamma\nabla_\theta L(\theta_t)$$

Explication

La mise à jour soustrait au paramètre actuel le gradient multiplié par le taux d’apprentissage, ce qui vise à se déplacer vers une perte plus faible. Ajouter le gradient inverse généralement la direction recherchée, car le gradient pointe vers la croissance locale de la perte.

14. Quels éléments jouent un rôle critique dans la convergence de la descente de gradient ?

Le taux d’apprentissage et l’initialisation des paramètres
La fonction d’activation et le nombre de classes prédites
La taille des sorties et la dimension des étiquettes
Le nombre de couches et la nature des données d’entrée

Le taux d’apprentissage et l’initialisation des paramètres

Explication

Le taux d’apprentissage contrôle l’amplitude des mises à jour et l’initialisation détermine le point de départ de l’optimisation ; tous deux influencent donc la convergence. Les autres couples concernent l’architecture ou la représentation des données, sans constituer les facteurs identifiés ici.

15. Quelle caractéristique distingue la mise à jour de la descente de gradient stochastique de celle du gradient par lots ?

Elle utilise tous les exemples par mise à jour et son coût d’itération augmente avec le jeu de données.
Elle utilise un seul exemple par mise à jour et son coût d’itération ne dépend pas de la taille du jeu de données.
Elle calcule une moyenne exacte des pertes et son coût d’itération reste lié au nombre de paramètres.
Elle remplace le gradient par une initialisation aléatoire et son coût d’itération dépend des classes.

Elle utilise un seul exemple par mise à jour et son coût d’itération ne dépend pas de la taille du jeu de données.

Explication

La SGD calcule une mise à jour à partir d’un exemple individuel, ce qui rend le coût d’une itération indépendant de la taille totale du jeu de données. Le gradient par lots, lui, utilise tous les exemples et son calcul devient plus coûteux lorsque leur nombre augmente.

16. Quelle opération réalise une couche entièrement connectée avant l’application de son activation ?

Elle calcule σ(Wx)\sigma(Wx), puis ajoute bb pour obtenir h=σ(Wx)+bh=\sigma(Wx)+b.
Elle calcule W+x+bW+x+b, puis applique σ\sigma pour obtenir h=σ(W+x+b)h=\sigma(W+x+b).
Elle calcule Wx+bWx+b, puis applique σ\sigma pour obtenir h=σ(Wx+b)h=\sigma(Wx+b).
Elle calcule W(x+b)W(x+b), puis applique σ\sigma pour obtenir h=σ(W(x+b))h=\sigma(W(x+b)).

Elle calcule $$Wx+b$$, puis applique $$\sigma$$ pour obtenir $$h=\sigma(Wx+b)$$.

Explication

Une couche entièrement connectée forme d’abord une transformation affine Wx+bWx+b, puis lui applique la fonction d’activation. Les autres expressions modifient l’ordre ou la nature des opérations, et ne correspondent pas à la formule de la couche.

17. Quelle description correspond à un perceptron multicouche ?

Un classifieur linéaire qui applique une seule transformation affine aux entrées.
Un système convolutif qui partage ses paramètres dans des fenêtres locales de l’entrée.
Un modèle récurrent qui conserve un état interne entre les étapes temporelles successives.
Un réseau entièrement connecté à propagation avant composé de couches affines et d’activations successives.

Un réseau entièrement connecté à propagation avant composé de couches affines et d’activations successives.

Explication

Le perceptron multicouche enchaîne, en propagation avant, des opérations affines et des fonctions d’activation dans des couches entièrement connectées. Un modèle récurrent dépend d’un état temporel, tandis qu’un classifieur linéaire ne possède pas cette succession de transformations non linéaires.

18. Pour une classification binaire, que représente la sortie sigmoïde de la dernière couche ?

Une valeur réelle non bornée destinée à une tâche de régression
Un vecteur de probabilités de dimension égale au nombre de classes
Une probabilité scalaire P(Y=1∣x)P(Y=1\mid x)
Une distribution normalisée obtenue en comparant plusieurs logits de classes

Une probabilité scalaire $$P(Y=1\mid x)$$

Explication

Dans une classification binaire, la sigmoïde produit une probabilité scalaire associée à l’événement Y=1Y=1. Un vecteur de probabilités entre plusieurs classes correspond plutôt à une sortie multiclasse, généralement obtenue avec une softmax.

19. Quelle formule définit la composante ii de la softmax pour une classification à CC classes ?

Softmax⁡(z)i=11+exp⁡(−zi)\operatorname{Softmax}(z)_i=\frac{1}{1+\exp(-z_i)}
Softmax⁡(z)i=exp⁡(zi)C\operatorname{Softmax}(z)_i=\frac{\exp(z_i)}{C}
Softmax⁡(z)i=zi∑j=1Czj\operatorname{Softmax}(z)_i=\frac{z_i}{\sum_{j=1}^{C}z_j}
Softmax⁡(z)i=exp⁡(zi)∑j=1Cexp⁡(zj)\operatorname{Softmax}(z)_i=\frac{\exp(z_i)}{\sum_{j=1}^{C}\exp(z_j)}

$$\operatorname{Softmax}(z)_i=\frac{\exp(z_i)}{\sum_{j=1}^{C}\exp(z_j)}$$

Explication

La softmax exponentie chaque score puis le normalise par la somme des exponentielles de tous les scores de classe. La fonction sigmoïde, représentée par la dernière expression, traite une sortie binaire plutôt qu’une normalisation entre plusieurs classes.

20. Quel est le rôle principal de la différentiation automatique dans l’entraînement d’un modèle ?

Mettre à jour les paramètres en suivant la direction du gradient
Choisir une architecture adaptée à la tâche étudiée
Produire les sorties du modèle à partir des données d’entrée
Calculer les dérivées de la perte par rapport à tous les paramètres

Calculer les dérivées de la perte par rapport à tous les paramètres

Explication

La différentiation automatique exploite le graphe computationnel pour obtenir les dérivées de la perte par rapport aux paramètres. La mise à jour des paramètres relève ensuite de la descente de gradient, qui utilise ces dérivées.

21. Pour une composition scalaire définie par y=y(u1,…,um)y=y(u_1,\dots,u_m) et uk=uk(x)u_k=u_k(x), quelle expression donne la dérivée dydx\frac{dy}{dx} ?

dydx=∑k=1m∂y∂uk∂uk∂x\frac{dy}{dx}=\sum_{k=1}^{m}\frac{\partial y}{\partial u_k}\frac{\partial u_k}{\partial x}
dydx=∏k=1m∂y∂uk∂uk∂x\frac{dy}{dx}=\prod_{k=1}^{m}\frac{\partial y}{\partial u_k}\frac{\partial u_k}{\partial x}
dydx=∑k=1m∂uk∂y∂x∂uk\frac{dy}{dx}=\sum_{k=1}^{m}\frac{\partial u_k}{\partial y}\frac{\partial x}{\partial u_k}
dydx=∂y∂x+∑k=1m∂uk∂y\frac{dy}{dx}=\frac{\partial y}{\partial x}+\sum_{k=1}^{m}\frac{\partial u_k}{\partial y}

$$\frac{dy}{dx}=\sum_{k=1}^{m}\frac{\partial y}{\partial u_k}\frac{\partial u_k}{\partial x}$$

Explication

La règle de chaîne additionne, pour chaque variable intermédiaire, le produit de la dérivée de la sortie par rapport à cette variable et de la dérivée de cette variable par rapport à l’entrée. Le produit de tous les termes ne convient pas lorsqu’il existe plusieurs chemins intermédiaires.

22. Dans un réseau neuronal, que désigne précisément la rétropropagation ?

L’application récursive de la règle de chaîne vers l’arrière dans le graphe computationnel
Le calcul successif des sorties depuis les entrées jusqu’à la dernière couche
La modification directe des paramètres avant le calcul de la perte du modèle
La sélection des paramètres ayant la plus grande influence sur la sortie finale

L’application récursive de la règle de chaîne vers l’arrière dans le graphe computationnel

Explication

La rétropropagation applique récursivement la règle de chaîne en remontant le graphe computationnel afin de calculer les dérivées par rapport aux paramètres. La propagation avant, en revanche, sert à calculer les sorties à partir des entrées.

Révisez avec les flashcards

Mémorisez les réponses avec 40 flashcards sur Bases des réseaux de neurones.

Quelle formule calcule une unité logique à seuil ?

f(x)=1{∑iwixi+b≥0}f(x)=\mathbf{1}\left\{\sum_i w_i x_i+b\geq 0\right\}.

Qui a introduit l'unité logique à seuil en 1943 ?

McCulloch et Pitts en 1943.

Comment s'exprime la porte logique OR par vote pondéré ?

or⁡(x1,x2)=1{x1+x2−0.5≥0}\operatorname{or}(x_1,x_2)=\mathbf{1}\{x_1+x_2-0.5\geq0\}.

Voir les flashcards →

Approfondir avec la fiche

Consultez la fiche de révision complète sur Bases des réseaux de neurones.

Voir la fiche →

Cours similaires

Crée tes propres QCM

Importe ton cours et l'IA génère des QCM avec corrections en 30 secondes.

Générateur de QCM