QCM : Régression Lasso et Elastic Net — 11 questions

Questions et réponses du QCM

1. Quelle propriété décrit correctement le prétraitement des variables dans ce modèle linéaire ?

Les variables explicatives sont centrées et réduites, tandis que YY est seulement centrée.
Les variables explicatives sont seulement centrées, tandis que YY est réduite.
Les variables explicatives ne sont pas transformées, tandis que YY est centrée.
Les variables explicatives et YY sont centrées et réduites selon la même procédure.

Les variables explicatives sont centrées et réduites, tandis que $$Y$$ est seulement centrée.

Explication

Chaque variable explicative vérifie une moyenne nulle et une moyenne des carrés égale à un, alors que YY vérifie seulement une moyenne nulle. La réduction de YY n’est donc pas une condition du modèle décrit.

2. Lorsque XTXX^TX est inversible, quelle expression donne l’estimateur des moindres carrés ordinaires ?

β^MCO=(XTX)−1XTY\hat\beta_{MCO}=(X^TX)^{-1}X^TY
β^MCO=XT(XTX)−1Y\hat\beta_{MCO}=X^T(X^TX)^{-1}Y
β^MCO=X(XTX)−1Y\hat\beta_{MCO}=X(X^TX)^{-1}Y
β^MCO=(XTY)−1XTX\hat\beta_{MCO}=(X^TY)^{-1}X^TX

$$\hat\beta_{MCO}=(X^TX)^{-1}X^TY$$

Explication

L’estimateur des moindres carrés ordinaires s’obtient en multipliant XTYX^TY par l’inverse de XTXX^TX. Les autres expressions inversent ou réordonnent des matrices sans respecter la formule d’estimation.

3. Quelle contrainte caractérise la formulation contrainte de l’estimateur Lasso ?

Minimiser la somme des carrés des résidus sous la contrainte ∥z∥2<t\|z\|_2<t, avec t>0t>0.
Minimiser la somme des carrés des résidus sans contrainte sur le vecteur zz.
Minimiser la somme absolue des résidus sous la contrainte ∥z∥1<t\|z\|_1<t, avec t>0t>0.
Minimiser la somme des carrés des résidus sous la contrainte ∥z∥1<t\|z\|_1<t, avec t>0t>0.

Minimiser la somme des carrés des résidus sous la contrainte $$\|z\|_1<t$$, avec $$t>0$$.

Explication

Le Lasso limite la norme ℓ1\ell_1 du vecteur des coefficients tout en minimisant la somme des carrés des résidus. Une contrainte en norme ℓ2\ell_2 correspond à une autre structure de régularisation, tandis que l’absence de contrainte ramène aux moindres carrés ordinaires.

4. Que devient la solution du Lasso lorsque le paramètre de pénalisation tend vers l’infini ?

Elle tend vers la solution des moindres carrés ordinaires, soit β^MCO\hat\beta_{MCO}.
Elle tend vers le vecteur des observations, soit β^Lasso=Y\hat\beta_{Lasso}=Y.
Elle tend vers l’inverse de la matrice de covariance, soit (XTX)−1(X^TX)^{-1}.
Elle tend vers le vecteur nul, soit β^Lasso=0\hat\beta_{Lasso}=0.

Elle tend vers le vecteur nul, soit $$\hat\beta_{Lasso}=0$$.

Explication

Une pénalisation de plus en plus forte de la norme ℓ1\ell_1 pousse tous les coefficients vers zéro. La solution des moindres carrés ordinaires correspond plutôt au cas λ=0\lambda=0 lorsqu’elle existe.

5. Qu'est-ce qu'une donnée centrée réduite dans le contexte d'un modèle linéaire ?

Une variable dont la moyenne est nulle et l'écart-type est unitaire pour chaque variable explicative.
Une variable dont la moyenne est égale à la médiane et dont la variance est nulle.
Une variable dont la moyenne est nulle et dont la variance est infinie.
Une variable dont la moyenne est égale à la variance et qui est normalisée par rapport à la variable dépendante.

Une variable dont la moyenne est nulle et l'écart-type est unitaire pour chaque variable explicative.

Explication

Une donnée centrée réduite a été transformée pour avoir une moyenne nulle et une variance unitaire, ce qui facilite l'interprétation et la convergence des modèles. La première option décrit précisément cette transformation, contrairement aux autres qui introduisent des concepts incorrects ou non liés.

6. Quelle est la formule du modèle linéaire en termes de la matrice des données X et du vecteur des paramètres β\beta ?

Y=Xβ+εY = X \beta + \varepsilon
Y=X+βεY = X + \beta \varepsilon
Y=βX+εY = \beta X + \varepsilon
Y=β+XεY = \beta + X \varepsilon

$$Y = X \\beta + \\varepsilon$$

Explication

La formule du modèle linéaire est donnée par Y=Xβ+εY = X \beta + \varepsilon, où X est la matrice des données et β\beta le vecteur des paramètres. La première option correspond à cette formulation standard.

7. Quel est le rôle principal de l'algorithme FSA dans la sélection de variables pour un modèle de régression ?

Il optimise la sélection de variables en utilisant une méthode de descente de coordonnées pour accélérer la convergence.
Il calcule directement la solution optimale en minimisant la somme des carrés des résidus sans pénalité.
Il suit l'évolution des coefficients lorsque la pénalité de régularisation diminue, permettant d'identifier les variables importantes.
Il ajuste les coefficients en fonction de la corrélation entre chaque variable et la variable dépendante, sans utiliser de pénalité.

Il suit l'évolution des coefficients lorsque la pénalité de régularisation diminue, permettant d'identifier les variables importantes.

Explication

L'algorithme FSA suit l'évolution des coefficients lorsque la pénalité de régularisation diminue, ce qui permet de sélectionner progressivement les variables importantes. Contrairement à la minimisation directe, il construit une solution en ajoutant des variables selon leur corrélation avec le résidu.

8. Quand l'algorithme de descente de coordonnées a-t-il été principalement développé pour optimiser les modèles de régression ?

Au début des années 2000, pour améliorer la convergence des méthodes itératives.
Dans les années 1980, pour traiter efficacement les grands ensembles de données.
Dans les années 2010, avec l'avènement du Big Data.
Au milieu des années 2010, avec l'essor du machine learning et des méthodes sparsity.

Dans les années 1980, pour traiter efficacement les grands ensembles de données.

Explication

L'algorithme de descente de coordonnées a été formalisé dans les années 1980 pour optimiser efficacement des fonctions avec plusieurs variables, notamment dans le contexte de la régression. Il a été popularisé par Friedman, Hastie et Tibshirani en 2010 pour la régularisation dans les modèles de régression.

9. En quoi la méthode Elastic Net diffère-t-elle principalement du Lasso en termes de pénalisation ?

L'Elastic Net combine la pénalisation ℓ₁ et ℓ₂, tandis que le Lasso utilise uniquement la norme ℓ₁.
L'Elastic Net ne pénalise pas la taille des coefficients, contrairement au Lasso.
Le Lasso est une méthode non convexe, alors que l'Elastic Net est convexe.
L'Elastic Net utilise uniquement la norme ℓ₂, alors que le Lasso utilise la norme ℓ₁.

L'Elastic Net combine la pénalisation ℓ₁ et ℓ₂, tandis que le Lasso utilise uniquement la norme ℓ₁.

Explication

L'Elastic Net combine une pénalisation ℓ₁ et ℓ₂, ce qui lui permet de bénéficier à la fois de la sélection de variables du Lasso et de la stabilité face aux corrélations élevées. Le Lasso utilise uniquement la norme ℓ₁, ce qui peut poser problème en présence de variables fortement corrélées.

10. Quelle est la principale conséquence de l'utilisation de la méthode Elastic Net lorsque des régresseurs sont fortement corrélés ?

Elle améliore la stabilité de la sélection des variables en combinant la pénalisation ℓ₁ et ℓ₂.
Elle augmente la variance des estimations, rendant le modèle moins robuste.
Elle réduit la complexité computationnelle par rapport au Lasso seul.
Elle élimine complètement la corrélation entre les régresseurs, rendant la modèle plus précis.

Elle améliore la stabilité de la sélection des variables en combinant la pénalisation ℓ₁ et ℓ₂.

Explication

L'Elastic Net pallie le défaut du Lasso en étant plus stable face aux régresseurs fortement corrélés, grâce à sa pénalisation combinée. La réduction de la corrélation n'est pas une conséquence directe, mais la stabilité de la sélection est améliorée.

11. Comment appliquer la méthode Elastic Net pour sélectionner des variables dans un modèle de régression avec des régresseurs fortement corrélés ?

En utilisant un paramètre \\alpha$ proche de 1 pour privilégier la sélection de variables, tout en ajustant \\lambda$ pour contrôler la régularisation.
En augmentant \\lambda$ à l'infini pour forcer tous les coefficients à devenir nuls.
En utilisant uniquement la pénalisation \\ell_1$ comme dans le Lasso, pour favoriser la sélection de variables.
En choisissant \\alpha$ égal à 0 pour privilégier la régularisation Ridge, ce qui évite la sélection de variables.

En utilisant un paramètre \\alpha$ proche de 1 pour privilégier la sélection de variables, tout en ajustant \\lambda$ pour contrôler la régularisation.

Explication

L'application de l'Elastic Net avec \\alpha$ proche de 1 favorise la sélection de variables tout en gérant la corrélation entre régresseurs. La méthode combine la pénalisation \\ell_1$ et \\ell_2$ pour pallier le problème du Lasso en présence de variables fortement corrélées.

Révisez avec les flashcards

Mémorisez les réponses avec 11 flashcards sur Régression Lasso et Elastic Net.

Quelles conditions définissent les données centrées réduites pour les variables explicatives ?

Les variables explicatives ont moyenne nulle et variance unitaire.

Quelle est la formule de l'estimateur des moindres carrés ordinaires ?

β^MCO=(XTX)−1XTY\hat\beta_{MCO}=(X^TX)^{-1}X^TY

Qu'impose la contrainte de l'estimateur Lasso ?

La norme ∥z∥1\|z\|_1 doit être inférieure à un seuil t>0t>0.

Voir les flashcards →

Approfondir avec la fiche

Consultez la fiche de révision complète sur Régression Lasso et Elastic Net.

Voir la fiche →

Cours similaires

Crée tes propres QCM

Importe ton cours et l'IA génère des QCM avec corrections en 30 secondes.

Générateur de QCM