QCM : Régression Lasso et Elastic Net — 18 questions

Questions et réponses du QCM

1. Une équipe veut sélectionner λ\lambda pour obtenir les meilleures prédictions sur de nouvelles données : quel critère doit-elle privilégier ?

La somme des coefficients estimés avant l’application de la pénalité.
L’erreur de prédiction estimée par validation croisée par blocs.
Le nombre de coordonnées mises à zéro par la solution régularisée.
La valeur de la pénalité L1L_1 observée sur l’échantillon complet.

L’erreur de prédiction estimée par validation croisée par blocs.

Explication

La validation croisée estime la capacité prédictive de chaque valeur de λ\lambda sur des données mises de côté dans les blocs. Le nombre de coefficients nuls et la norme de pénalisation renseignent sur la complexité, mais pas directement sur l’erreur de prédiction.

2. Quelle combinaison de pénalités définit l’estimateur Elastic Net ?

Une combinaison pondérée des pénalités L2L_2 et L1L_1, ajoutée à l’erreur quadratique.
Une pénalité L2L_2 appliquée aux résidus, sans contrainte sur les coefficients.
Une pénalité fondée sur le nombre de variables sélectionnées, sans norme des coefficients.
Une pénalité L1L_1 appliquée à l’erreur absolue des résidus, sans terme quadratique.

Une combinaison pondérée des pénalités $$L_2$$ et $$L_1$$, ajoutée à l’erreur quadratique.

Explication

Elastic Net minimise une erreur quadratique augmentée d’un mélange pondéré de normes L2L_2 et L1L_1, contrôlé par λ\lambda et α\alpha. Le Lasso ne comporte que la pénalisation L1L_1, tandis que Ridge ne comporte que la pénalisation L2L_2.

3. Quelle propriété distingue la sélection de variables réalisée par le Lasso d’un simple rétrécissement des coefficients ?

Tous les coefficients sont rapprochés de zéro sans jamais l’atteindre
Les variables sont sélectionnées en fonction de la taille de leurs unités
Certaines composantes peuvent devenir exactement nulles
Les coefficients sont remplacés par leurs valeurs absolues

Certaines composantes peuvent devenir exactement nulles

Explication

Le Lasso peut produire des coefficients exactement égaux à zéro, ce qui élimine les variables correspondantes du modèle. Un simple rétrécissement réduit les coefficients vers zéro sans nécessairement les rendre nuls.

4. Quelle contrainte caractérise la formulation du problème d’optimisation du Lasso ?

Minimiser la somme des carrés des résidus sous ∥z∥2≤t\|z\|_2\le t, avec t>0t>0
Minimiser la somme des carrés des résidus sans contrainte sur le vecteur z
Minimiser la norme ∥z∥1\|z\|_1 sous une contrainte sur la somme des résidus
Minimiser la somme des carrés des résidus sous ∥z∥1≤t\|z\|_1\le t, avec t>0t>0

Minimiser la somme des carrés des résidus sous $$\|z\|_1\le t$$, avec $$t>0$$

Explication

Le Lasso minimise la somme des carrés des résidus en imposant la contrainte ∥z∥1≤t\|z\|_1\le t, avec t strictement positif. La norme L2 est associée à la formulation classique de Ridge, et non à la contrainte du Lasso.

5. Dans quelle situation le seuillage doux fixe-t-il le coefficient Lasso βj\beta_j à zéro ?

Lorsque ∣βj∗∣|\beta_j^*| est inférieur à λn\frac{\lambda}{n} mais supérieur à zéro.
Lorsque ∣βj∗∣=λn|\beta_j^*|=\frac{\lambda}{n}.
Lorsque ∣βj∗∣≤λ2n|\beta_j^*|\le\frac{\lambda}{2n}.
Lorsque ∣βj∗∣≥λ2n|\beta_j^*|\ge\frac{\lambda}{2n}.

Lorsque $$|\beta_j^*|\le\frac{\lambda}{2n}$$.

Explication

Le seuillage doux annule le coefficient lorsque la valeur absolue de la mise à jour MCO ne dépasse pas λ/(2n)\lambda/(2n). Au-delà de ce seuil, le coefficient est rapproché de zéro sans être annulé par cette règle.

6. Quelle séquence décrit correctement un passage de l’algorithme de descente de coordonnées pour le Lasso ?

Initialiser les coefficients, calculer la validation croisée, modifier les prédicteurs, puis appliquer la mise à jour MCO.
Calculer tous les coefficients MCO, choisir une pénalité, réinitialiser les résidus, puis effectuer un seul passage.
Initialiser les résidus, appliquer le seuillage doux à toutes les coordonnées, calculer les coefficients, puis arrêter.
Initialiser les coefficients, calculer le résidu partiel, effectuer la mise à jour MCO, appliquer le seuillage doux, puis répéter.

Initialiser les coefficients, calculer le résidu partiel, effectuer la mise à jour MCO, appliquer le seuillage doux, puis répéter.

Explication

L’algorithme alterne le calcul du résidu partiel, l’obtention de βj∗\beta_j^*, le seuillage doux et les passages successifs sur les coordonnées jusqu’à convergence. La validation croisée ne fait pas partie de cette séquence de mise à jour interne.

7. Lors d’une étape de l’algorithme Forward Stagewise, comment la variable et la direction de mise à jour sont-elles déterminées ?

La variable est choisie au hasard, puis tous les coefficients actifs augmentent du même pas positif
La variable ayant la corrélation absolue maximale est choisie, puis les coefficients sont ajustés selon le signe de leur corrélation
La variable ayant la corrélation positive maximale est choisie, puis tous les coefficients actifs diminuent
La variable ayant la plus faible corrélation absolue est choisie, puis les coefficients sont ajustés selon leur variance

La variable ayant la corrélation absolue maximale est choisie, puis les coefficients sont ajustés selon le signe de leur corrélation

Explication

Le FSA sélectionne la variable correspondant à la corrélation absolue maximale avec le résidu, tandis que le signe de cette corrélation détermine la direction de la mise à jour. Confondre critère de sélection et direction conduirait à choisir selon une corrélation signée ou à imposer une direction unique.

8. Quelle fonction le Lasso minimise-t-il dans sa formulation pénalisée ?

Gλ(z)=∥Y−Xz∥22+λ∥z∥1G_\lambda(z)=\|Y-Xz\|_2^2+\lambda\|z\|_1 avec λ>0\lambda>0
Gλ(z)=∥Y−Xz∥1+λ∥z∥22G_\lambda(z)=\|Y-Xz\|_1+\lambda\|z\|_2^2 avec λ>0\lambda>0
Gλ(z)=∥Y−Xz∥22−λ∥z∥1G_\lambda(z)=\|Y-Xz\|_2^2-\lambda\|z\|_1 avec λ>0\lambda>0
Gλ(z)=∥Y−Xz∥1+λ∥z∥1G_\lambda(z)=\|Y-Xz\|_1+\lambda\|z\|_1 avec λ<0\lambda<0

$$G_\lambda(z)=\|Y-Xz\|_2^2+\lambda\|z\|_1$$ avec $$\lambda>0$$

Explication

La formulation pénalisée additionne le terme de résidus au carré et une pénalité L1 pondérée par λ>0\lambda>0. Une pénalité soustraite ou fondée sur une autre combinaison de normes ne correspond pas au Lasso.

9. Quel principe caractérise la descente de coordonnées dans l’optimisation du Lasso ?

Elle optimise une coordonnée puis réinitialise les coefficients précédents.
Elle optimise toutes les coordonnées simultanément à chaque itération.
Elle optimise une coordonnée à la fois en maintenant les autres fixes.
Elle optimise d’abord les coefficients les plus élevés puis les autres.

Elle optimise une coordonnée à la fois en maintenant les autres fixes.

Explication

La descente de coordonnées met à jour successivement une seule coordonnée, tandis que les autres restent fixes, puis répète ces passages jusqu’à convergence. La minimisation simultanée de toutes les coordonnées correspond à une autre stratégie d’optimisation.

10. Avec βj∗=XjTRjn\beta_j^*=\frac{X_j^TR_j}{n}, quelle expression donne la mise à jour Lasso par seuillage doux ?

βj=βj∗(1−λ2n∣βj∗∣)+\beta_j=\beta_j^*\left(1-\frac{\lambda}{2n|\beta_j^*|}\right)_+
βj=signe⁡(βj∗)(∣βj∗∣+λ2n)\beta_j=\operatorname{signe}(\beta_j^*)\left(|\beta_j^*|+\frac{\lambda}{2n}\right)
βj=βj∗1+λ/(2n)\beta_j=\frac{\beta_j^*}{1+\lambda/(2n)}
βj=βj∗+λ2n∣βj∗∣\beta_j=\beta_j^*+\frac{\lambda}{2n|\beta_j^*|}

$$\beta_j=\beta_j^*\left(1-\frac{\lambda}{2n|\beta_j^*|}\right)_+$$

Explication

La mise à jour Lasso réduit la valeur absolue de βj∗\beta_j^* par un facteur de seuillage doux dépendant de λ/(2n∣βj∗∣)\lambda/(2n|\beta_j^*|). Une addition ou une simple contraction multiplicative ne représente pas ce seuillage.

11. Quelle mise à jour par descente de coordonnées correspond à Elastic Net, avec βj∗=XjTRj/n\beta_j^*=X_j^TR_j/n ?

βj=signe⁡(βj∗)(∣βj∗∣+αλ)+1+λ(1−α)\beta_j=\operatorname{signe}(\beta_j^*)\frac{(|\beta_j^*|+\alpha\lambda)_+}{1+\lambda(1-\alpha)}
βj=βj∗(1−λ2n∣βj∗∣)+\beta_j=\beta_j^*\left(1-\frac{\lambda}{2n|\beta_j^*|}\right)_+
βj=signe⁡(βj∗)(∣βj∗∣−αλ)+1+λ(1−α)\beta_j=\operatorname{signe}(\beta_j^*)\frac{(|\beta_j^*|-\alpha\lambda)_+}{1+\lambda(1-\alpha)}
βj=βj∗1−λ(1−α)+αλ\beta_j=\frac{\beta_j^*}{1-\lambda(1-\alpha)}+\alpha\lambda

$$\beta_j=\operatorname{signe}(\beta_j^*)\frac{(|\beta_j^*|-\alpha\lambda)_+}{1+\lambda(1-\alpha)}$$

Explication

La mise à jour Elastic Net applique un seuillage de niveau αλ\alpha\lambda, puis une contraction par le dénominateur 1+λ(1−α)1+\lambda(1-\alpha). La troisième expression est la mise à jour spécifique du Lasso avec une autre convention de pénalisation.

12. Comment choisir un paramètre de régularisation λ\lambda à l’aide de la validation croisée ?

Choisir la valeur qui donne la norme L1L_1 la plus faible, sans évaluer les prédictions.
Calculer les solutions pour plusieurs valeurs, estimer l’erreur prédictive par blocs et retenir celle qui la minimise.
Fixer la valeur qui maximise l’erreur d’apprentissage afin de limiter l’ajustement du modèle.
Retenir la valeur qui produit le plus grand nombre de coefficients non nuls dans le modèle.

Calculer les solutions pour plusieurs valeurs, estimer l’erreur prédictive par blocs et retenir celle qui la minimise.

Explication

La procédure compare une suite de paramètres au moyen d’une estimation de l’erreur de prédiction par validation croisée, puis retient celui dont l’erreur est minimale. La norme L1L_1 décrit la pénalisation, mais ne mesure pas directement la performance prédictive.

13. Que devient Elastic Net lorsque α=0\alpha=0 et lorsque α=1\alpha=1 ?

Il correspond au Lasso pour α=0\alpha=0 et à Ridge pour α=1\alpha=1.
Il correspond à une régression non pénalisée pour α=0\alpha=0 et à Ridge pour α=1\alpha=1.
Il correspond à Ridge pour α=0\alpha=0 et au Lasso pour α=1\alpha=1.
Il conserve le même mélange de pénalités pour les deux valeurs de α\alpha.

Il correspond à Ridge pour $$\alpha=0$$ et au Lasso pour $$\alpha=1$$.

Explication

Le paramètre α\alpha contrôle la composition de la pénalisation : sa valeur nulle conserve le terme Ridge, tandis que sa valeur égale à un conserve le terme Lasso. Inverser ces deux cas conduit à une interprétation erronée du rôle de α\alpha.

14. Sous quelle condition l’estimateur des moindres carrés ordinaires β^MCO=(XTX)−1XTY\hat\beta_{MCO}=(X^TX)^{-1}X^TY est-il défini par cette expression ?

Lorsque la matrice XTXX^TX est inversible
Lorsque toutes les erreurs ε\varepsilon sont nulles
Lorsque la matrice XTYX^TY est diagonale
Lorsque le vecteur réponse Y est non centré

Lorsque la matrice $$X^TX$$ est inversible

Explication

La formule des MCO utilise l’inverse de XTXX^TX et requiert donc que cette matrice soit inversible. Le centrage de Y, la structure de XTYX^TY ou l’absence d’erreurs ne garantissent pas cette condition.

15. Quelle structure correspondent aux données utilisées dans ce modèle linéaire ?

n observations, une variable explicative quantitative et p réponses
p observations, n variables explicatives qualitatives et une variable réponse
n observations, p variables explicatives quantitatives et une variable réponse
p observations, n variables réponses quantitatives et une variable explicative

n observations, p variables explicatives quantitatives et une variable réponse

Explication

Les données comportent n observations de p variables explicatives quantitatives ainsi qu’une variable réponse Y. Inverser n et p ou confondre variables explicatives et réponses décrit une structure différente.

16. Que devient la solution du Lasso lorsque t>∥β^MCO∥1t>\|\hat\beta_{MCO}\|_1 ?

Elle coïncide avec une solution fondée sur une contrainte de norme L2
Elle exclut les variables dont les coefficients MCO sont les plus faibles
Elle devient nécessairement un vecteur dont toutes les composantes sont nulles
Elle coïncide avec l’estimateur des moindres carrés ordinaires

Elle coïncide avec l’estimateur des moindres carrés ordinaires

Explication

Si t dépasse la norme L1 de l’estimateur MCO, celui-ci satisfait la contrainte et reste la solution du problème Lasso. Une telle valeur de t n’impose pas une sélection de variables ni une contrainte de norme L2.

17. Comment évoluent les chemins de régularisation lorsque λ\lambda diminue à partir d’une valeur très élevée ?

Tous les coefficients partent des valeurs MCO, puis les variables sortent progressivement du modèle
Tous les coefficients partent de zéro, puis des variables entrent progressivement dans le modèle
Les variables entrent simultanément avec des coefficients nécessairement identiques
Les coefficients restent nuls, car une diminution de λ\lambda renforce la régularisation

Tous les coefficients partent de zéro, puis des variables entrent progressivement dans le modèle

Explication

Pour une pénalité suffisamment grande, tous les coefficients sont nuls, puis des variables apparaissent lorsque λ\lambda diminue. Une diminution de la pénalité permet donc généralement davantage de coefficients non nuls.

18. Quelle expression décrit correctement le modèle linéaire reliant la réponse aux variables explicatives et aux erreurs ?

Y=Xβ−εY=X\beta-\varepsilon
Y=β+X+εY=\beta+X+\varepsilon
Y=X+βεY=X+\beta\varepsilon
Y=Xβ+εY=X\beta+\varepsilon

$$Y=X\beta+\varepsilon$$

Explication

Le modèle linéaire s’écrit Y=Xβ+εY=X\beta+\varepsilon, où le terme d’erreur représente la part non expliquée par les variables. L’expression XβX\beta seule correspond à une prédiction déterministe et ne constitue pas le modèle linéaire complet.

Révisez avec les flashcards

Mémorisez les réponses avec 41 flashcards sur Régression Lasso et Elastic Net.

Comment s'écrit le modèle linéaire ?

Le modèle linéaire s'écrit Y=Xβ+εY=X\beta+\varepsilon.

Que comprennent les données en régression linéaire ?

Elles comprennent n observations de p variables explicatives quantitatives et une variable réponse Y.

Quelle condition impose la centration des variables explicatives ?

La moyenne de chaque variable explicative est nulle, soit 1n∑j=1nxj,k=0\frac{1}{n}\sum_{j=1}^{n}x_{j,k}=0.

Voir les flashcards →

Approfondir avec la fiche

Consultez la fiche de révision complète sur Régression Lasso et Elastic Net.

Voir la fiche →

Cours similaires

Crée tes propres QCM

Importe ton cours et l'IA génère des QCM avec corrections en 30 secondes.

Générateur de QCM