QCM : Régression linéaire Ridge — 23 questions

Questions et réponses du QCM

1. Comment sélectionne-t-on une pénalité Ridge à l’aide de la validation croisée généralisée ?

On choisit la plus grande valeur de la grille pour maximiser la régularisation
On retient la valeur associée à l’erreur d’ajustement la plus élevée
On fixe λ\lambda à zéro lorsque plusieurs valeurs donnent des résultats proches
On évalue GCV sur une grille de valeurs et on retient celle qui le minimise

On évalue GCV sur une grille de valeurs et on retient celle qui le minimise

Explication

La procédure consiste à calculer GCV pour les valeurs λ1,…,λq\lambda_1,\ldots,\lambda_q d’une grille, puis à sélectionner la valeur minimisant le critère. Maximiser GCV ou se baser uniquement sur l’erreur d’ajustement ne correspond pas à cette règle de choix.

2. Quelle contrainte caractérise la formulation contrainte de la régression Ridge ?

Une pénalisation directe de la variance des résidus
Une borne sur la somme des valeurs absolues des coefficients
Une contrainte imposée à la norme euclidienne des observations
Une borne sur la norme euclidienne au carré des coefficients

Une borne sur la norme euclidienne au carré des coefficients

Explication

Ridge limite la norme ℓ2\ell_2 des coefficients, c’est-à-dire ∥z∥22\|z\|_2^2. La contrainte fondée sur la somme des valeurs absolues correspond plutôt au Lasso, qui utilise une norme ℓ1\ell_1.

3. Quelle propriété caractérise l’estimateur MCO parmi les estimateurs linéaires sans biais ?

Il est biaisé et possède une variance minimale.
Il est biaisé afin de réduire directement la variance.
Il est sans biais et possède la variance maximale.
Il est sans biais et possède une variance minimale.

Il est sans biais et possède une variance minimale.

Explication

L’estimateur MCO est sans biais et, parmi les estimateurs linéaires sans biais, il atteint la variance minimale. Le biais introduit par Ridge constitue une propriété différente, liée à la régularisation.

4. Pourquoi le calcul de Sλ−1=V(D2+λIp)−1VTS_\lambda^{-1}=V(D^2+\lambda I_p)^{-1}V^T est-il particulièrement pratique avec la SVD ?

Parce que l’inversion porte sur une matrice entièrement dense
Parce que l’inversion porte sur une matrice diagonale
Parce que les coefficients sont calculés sans connaître VV
Parce que la pénalité disparaît après la factorisation

Parce que l’inversion porte sur une matrice diagonale

Explication

La SVD transforme la matrice à inverser en une matrice diagonale D2+λIpD^2+\lambda I_p, dont l’inversion se fait terme par terme. La factorisation ne supprime pas la pénalité et les matrices VV restent nécessaires dans la reconstruction de l’inverse.

5. Dans la forme vectorielle du modèle linéaire, quel rôle joue la colonne de 1 ajoutée à la matrice de conception ?

Elle permet d’intégrer le terme constant β0\beta_0.
Elle remplace le vecteur des erreurs dans l’équation du modèle.
Elle impose une variance commune σ2\sigma^2 aux erreurs.
Elle représente une variable explicative supplémentaire mesurée.

Elle permet d’intégrer le terme constant $$\beta_0$$.

Explication

La colonne de 1 permet d’associer la constante β0\beta_0 à chaque observation dans l’écriture Y=Xβ+εY=X\beta+\varepsilon. Elle ne décrit ni la variance des erreurs ni le vecteur aléatoire des perturbations.

6. Que devient l’estimateur Ridge lorsque le seuil tt est supérieur à ∥β^MCO∥22\|\hat\beta_{MCO}\|_2^2 ?

Il prend la même valeur que l’estimateur obtenu avec t=0t=0
Il coïncide avec l’estimateur des moindres carrés ordinaires
Il devient un vecteur de coefficients tous égaux à zéro
Il impose une réduction supplémentaire des coefficients MCO

Il coïncide avec l’estimateur des moindres carrés ordinaires

Explication

Lorsque la contrainte est assez large, l’estimateur MCO reste admissible et Ridge coïncide avec lui. À l’inverse, le choix t=0t=0 conduit à l’estimateur nul, ce qui rend les deux situations opposées.

7. Quel critère définit l’estimateur des moindres carrés ordinaires ?

Il maximise la variance expliquée sans considérer les résidus.
Il minimise la somme des carrés des résidus.
Il minimise une pénalité ajoutée aux coefficients.
Il minimise la somme des valeurs absolues des coefficients.

Il minimise la somme des carrés des résidus.

Explication

L’estimateur MCO choisit les coefficients qui minimisent ∥Y−Xz∥2\|Y-Xz\|^2, c’est-à-dire la somme des carrés des résidus. L’ajout d’une pénalité aux coefficients caractérise plutôt une méthode régularisée comme Ridge.

8. Quelle solution explicite correspond à l’estimateur Ridge pénalisé ?

(XTX+λIp)−1XTY(X^TX+\lambda I_p)^{-1}X^TY
(XTX)−1XTY+λIp(X^TX)^{-1}X^TY+\lambda I_p
(XTX−λIp)−1XTY(X^TX-\lambda I_p)^{-1}X^TY
(XTX+λIp)−1YTX(X^TX+\lambda I_p)^{-1}Y^TX

$$(X^TX+\lambda I_p)^{-1}X^TY$$

Explication

La solution explicite de Ridge est obtenue en remplaçant la matrice des produits croisés par XTX+λIpX^TX+\lambda I_p, puis en la multipliant par XTYX^TY. Le terme de régularisation s’ajoute dans la matrice à inverser et ne se place pas après l’estimation MCO.

9. Une fois les coefficients Ridge estimés sur les variables standardisées, comment obtient-on le coefficient associé à la variable originale jj ?

En utilisant β^jridge=α^jridgesj\hat\beta^{ridge}_j=\hat\alpha^{ridge}_j s_j
En utilisant β^jridge=α^jridge/sj\hat\beta^{ridge}_j=\hat\alpha^{ridge}_j/s_j
En utilisant β^jridge=α^jridge+mjsj\hat\beta^{ridge}_j=\hat\alpha^{ridge}_j+m_j s_j
En utilisant β^jridge=α^jridge−mj/sj\hat\beta^{ridge}_j=\hat\alpha^{ridge}_j-m_j/s_j

En utilisant $$\hat\beta^{ridge}_j=\hat\alpha^{ridge}_j s_j$$

Explication

Le retour aux unités originales multiplie le coefficient standardisé par l’écart-type correspondant, selon β^jridge=α^jridgesj\hat\beta^{ridge}_j=\hat\alpha^{ridge}_j s_j. La division par sjs_j correspondrait à une transformation inverse mal appliquée dans cette convention.

10. Quelle distinction entre les normes ℓ1\ell_1 et ℓ2\ell_2 est correcte pour un vecteur de coefficients ?

ℓ1\ell_1 additionne les valeurs absolues, tandis que ℓ2\ell_2 utilise la racine de la somme des carrés.
ℓ1\ell_1 additionne les coefficients signés, tandis que ℓ2\ell_2 additionne leurs valeurs absolues.
ℓ1\ell_1 calcule la somme des carrés, tandis que ℓ2\ell_2 calcule la somme des valeurs absolues.
ℓ1\ell_1 utilise la racine de la somme des carrés, tandis que ℓ2\ell_2 additionne les valeurs absolues.

$$\ell_1$$ additionne les valeurs absolues, tandis que $$\ell_2$$ utilise la racine de la somme des carrés.

Explication

La norme ℓ1\ell_1 vaut ∑j=1p∣βj∣\sum_{j=1}^p|\beta_j|, alors que la norme ℓ2\ell_2 vaut ∑j=1pβj2\sqrt{\sum_{j=1}^p\beta_j^2}. La confusion fréquente consiste à attribuer à ℓ1\ell_1 la racine de la somme des carrés.

11. Quelle expression définit le critère de validation croisée généralisée utilisé pour choisir λ\lambda ?

GCV(λ)=∥Y−A(λ)Y∥n(trace⁡(In−A(λ)))2GCV(\lambda)=\frac{\|Y-A(\lambda)Y\|}{n(\operatorname{trace}(I_n-A(\lambda)))^2}
GCV(λ)=∥Y−A(λ)Y∥2trace⁡(In+A(λ))GCV(\lambda)=\frac{\|Y-A(\lambda)Y\|^2}{\operatorname{trace}(I_n+A(\lambda))}
GCV(λ)=∥Y−XA(λ)Y∥2(trace⁡(In−A(λ)))2GCV(\lambda)=\frac{\|Y-XA(\lambda)Y\|^2}{(\operatorname{trace}(I_n-A(\lambda)))^2}
GCV(λ)=∥Y−A(λ)Y∥2(trace⁡(In−A(λ)))2/nGCV(\lambda)=\frac{\|Y-A(\lambda)Y\|^2}{(\operatorname{trace}(I_n-A(\lambda)))^2/n}

$$GCV(\lambda)=\frac{\|Y-A(\lambda)Y\|^2}{(\operatorname{trace}(I_n-A(\lambda)))^2/n}$$

Explication

Le critère GCV met au numérateur l’erreur ajustée ∥Y−A(λ)Y∥2\|Y-A(\lambda)Y\|^2 et au dénominateur (trace⁡(In−A(λ)))2/n\left(\operatorname{trace}(I_n-A(\lambda))\right)^2/n. Les autres expressions modifient soit le dénominateur, soit la puissance de la norme, soit la matrice intervenant dans l’erreur.

12. Quel compromis caractérise l’estimateur Ridge par rapport à l’estimateur MCO lorsque celui-ci existe ?

Il introduit un biais tout en réduisant la variance
Il conserve le biais et réduit uniquement l’erreur des résidus
Il augmente le biais et la variance des coefficients
Il supprime le biais tout en conservant la même variance

Il introduit un biais tout en réduisant la variance

Explication

Ridge est biaisé, car son espérance vaut une transformation régularisée de β\beta, mais sa variance est inférieure à celle de MCO. Le gain de stabilité provient donc d’un compromis entre davantage de biais et moins de variance.

13. Dans quelle situation Ridge fournit-elle une solution alors que les MCO ne fournissent pas de solution unique ?

Lorsque le nombre de régresseurs dépasse la taille de l’échantillon
Lorsque les régresseurs sont tous indépendants et l’échantillon très grand
Lorsque chaque régresseur possède une échelle de mesure différente
Lorsque la variable réponse est centrée sans standardisation des prédicteurs

Lorsque le nombre de régresseurs dépasse la taille de l’échantillon

Explication

Ridge fournit une solution lorsque le nombre de régresseurs est supérieur à la taille de l’échantillon, cas où les MCO ne donnent pas de solution unique. Des échelles différentes ou le centrage de la réponse ne constituent pas, à eux seuls, la condition caractéristique décrite ici.

14. Que devient la constante dans le modèle lorsque les variables explicatives sont centrées et réduites et que la réponse est centrée ?

Elle est estimée comme la somme des pentes standardisées.
Elle est fixée à la moyenne non centrée de la réponse.
Elle n’est pas modélisée dans la formulation retenue.
Elle est remplacée par la variance commune des erreurs.

Elle n’est pas modélisée dans la formulation retenue.

Explication

Avec des variables explicatives centrées et une réponse centrée, la formulation du modèle ne comporte pas de constante. La moyenne de la réponse intervient plutôt dans l’interprétation d’un modèle avec interception avant centrage.

15. Quelle expression donne la variance de l’estimateur des moindres carrés ordinaires ?

Var⁡(β^MCO)=(XTX)−1XTY\operatorname{Var}(\hat\beta_{MCO})=(X^TX)^{-1}X^TY
Var⁡(β^MCO)=σ2XTX\operatorname{Var}(\hat\beta_{MCO})=\sigma^2X^TX
Var⁡(β^MCO)=σ2(XTX)−2\operatorname{Var}(\hat\beta_{MCO})=\sigma^2(X^TX)^{-2}
Var⁡(β^MCO)=σ2(XTX)−1\operatorname{Var}(\hat\beta_{MCO})=\sigma^2(X^TX)^{-1}

$$\operatorname{Var}(\hat\beta_{MCO})=\sigma^2(X^TX)^{-1}$$

Explication

La variance de l’estimateur MCO est donnée par σ2(XTX)−1\sigma^2(X^TX)^{-1}. Le produit XTXX^TX intervient donc par son inverse, et l’expression contenant XTYX^TY correspond à l’estimation elle-même plutôt qu’à sa variance.

16. Quel effet une forte multicolinéarité entre les variables explicatives peut-elle avoir sur l’estimation MCO ?

Elle supprime la nécessité de vérifier l’inversibilité de XTXX^TX.
Elle diminue la variance des coefficients et stabilise les prévisions.
Elle augmente la variance des coefficients et peut dégrader les prévisions.
Elle rend les erreurs nécessairement biaisées et corrélées.

Elle augmente la variance des coefficients et peut dégrader les prévisions.

Explication

Des régresseurs fortement corrélés rendent l’estimation des effets individuels instable, ce qui augmente la variance et peut dégrader les prévisions. Cette difficulté explique notamment l’intérêt de méthodes de régularisation comme Ridge.

17. Sous quelle condition la formule explicite β^MCO=(XTX)−1XTY\hat\beta_{MCO}=(X^TX)^{-1}X^TY est-elle applicable ?

Lorsque la matrice XTXX^TX est inversible.
Lorsque la matrice XTXX^TX est diagonale.
Lorsque les variables explicatives ont une moyenne nulle.
Lorsque toutes les erreurs sont nulles.

Lorsque la matrice $$X^TX$$ est inversible.

Explication

La formule explicite MCO utilise l’inverse de XTXX^TX et exige donc que cette matrice soit inversible. Une moyenne nulle des variables peut simplifier l’interprétation, mais ne garantit pas cette inversibilité.

18. Quelle écriture correspond à la décomposition en valeurs singulières d’une matrice XX ?

X=UD−1VTX=U D^{-1} V^T, avec DD représentant la matrice de covariance
X=UTDVX=U^T D V, avec UU et VV deux matrices diagonales
X=U+D+VTX=U+D+V^T, avec les trois matrices de dimensions compatibles
X=UDVTX=UDV^T, avec UU à colonnes orthonormées, DD diagonale et VV orthogonale

$$X=UDV^T$$, avec $$U$$ à colonnes orthonormées, $$D$$ diagonale et $$V$$ orthogonale

Explication

La décomposition SVD factorise XX sous la forme UDVTUDV^T, en associant à UU des colonnes orthonormées, à DD une structure diagonale et à VV une structure orthogonale. L’expression avec D−1D^{-1} ne décrit pas la décomposition elle-même, mais pourrait intervenir dans d’autres calculs.

19. Pourquoi l’estimateur Ridge reste-t-il calculable lorsque XTXX^TX n’est pas inversible ?

Parce que Ridge supprime les colonnes redondantes de la matrice XX
Parce que XTX+λIpX^TX+\lambda I_p devient inversible pour λ>0\lambda>0
Parce que la matrice XTXX^TX devient inversible après centrage des variables
Parce que la pénalité remplace le produit XTYX^TY par une matrice identité

Parce que $$X^TX+\lambda I_p$$ devient inversible pour $$\lambda>0$$

Explication

L’ajout de λIp\lambda I_p rend XTX+λIpX^TX+\lambda I_p inversible dès que λ>0\lambda>0, ce qui garantit l’existence de la solution Ridge. La méthode ne nécessite pas de supprimer les variables ni de modifier le produit XTYX^TY.

20. Quelle écriture représente correctement un modèle linéaire multiple reliant une réponse à plusieurs variables explicatives ?

Yj=β0+β1xj,1+⋯+βpxj,p+σ2Y_j=\beta_0+\beta_1x_{j,1}+\cdots+\beta_px_{j,p}+\sigma^2
Yj=β0+β1xj,1+⋯+βpxj,p+εjY_j=\beta_0+\beta_1x_{j,1}+\cdots+\beta_px_{j,p}+\varepsilon_j
Yj=β1+β2xj,1+⋯+βp+1xj,p+εjY_j=\beta_1+\beta_2x_{j,1}+\cdots+\beta_{p+1}x_{j,p}+\varepsilon_j
Yj=β0+β1xj,1+⋯+βpxj,pεjY_j=\beta_0+\beta_1x_{j,1}+\cdots+\beta_px_{j,p}\varepsilon_j

$$Y_j=\beta_0+\beta_1x_{j,1}+\cdots+\beta_px_{j,p}+\varepsilon_j$$

Explication

Le modèle linéaire multiple additionne une constante, les effets des variables explicatives et une erreur aléatoire. La variance σ2\sigma^2 décrit la dispersion des erreurs, mais ne remplace pas le terme d’erreur individuel εj\varepsilon_j.

21. Quelle distinction décrit correctement Ridge par rapport à une méthode de sélection de variables ?

Ridge transforme les régresseurs en variables latentes, tandis que la sélection augmente leur nombre
Ridge élimine les régresseurs corrélés, tandis que la sélection les conserve tous
Ridge conserve les régresseurs, tandis que la sélection en élimine certains
Ridge conserve les régresseurs non corrélés, tandis que la sélection réduit leurs coefficients

Ridge conserve les régresseurs, tandis que la sélection en élimine certains

Explication

La régression Ridge maintient tous les régresseurs dans le modèle, même lorsqu’ils sont fortement corrélés, en réduisant leurs coefficients. Une méthode de sélection agit différemment en retirant certains régresseurs du modèle.

22. Quelle suite d’étapes décrit correctement la mise en œuvre pratique de la régression Ridge ?

Estimer Ridge sur les variables brutes, standardiser les résidus, puis calculer les moyennes
Calculer les moyennes et écarts-types, standardiser, estimer Ridge, puis reconvertir les coefficients
Calculer les coefficients originaux, réduire les prédicteurs, puis supprimer les variables corrélées
Sélectionner des variables, centrer la réponse, puis appliquer Ridge sans reconversion

Calculer les moyennes et écarts-types, standardiser, estimer Ridge, puis reconvertir les coefficients

Explication

La procédure consiste à calculer les moyennes et écarts-types, à centrer-réduire les variables, à ajuster Ridge, puis à transformer les coefficients vers les unités originales. La standardisation ne remplace donc ni l’estimation sur les données réduites ni la reconversion finale.

23. Quelle expression représente la formulation pénalisée de l’estimateur Ridge pour λ>0\lambda>0 ?

arg⁡min⁡z{∥Y−Xz∥22+λ∥Y−z∥22}\arg\min_z\{\|Y-Xz\|_2^2+\lambda\|Y-z\|_2^2\}
arg⁡min⁡z{∥Y−Xz∥22+λ∥z∥22}\arg\min_z\{\|Y-Xz\|_2^2+\lambda\|z\|_2^2\}
arg⁡min⁡z{∥Y−Xz∥22−λ∥z∥22}\arg\min_z\{\|Y-Xz\|_2^2-\lambda\|z\|_2^2\}
arg⁡min⁡z{∥Y−Xz∥22+λ∥z∥1}\arg\min_z\{\|Y-Xz\|_2^2+\lambda\|z\|_1\}

$$\arg\min_z\{\|Y-Xz\|_2^2+\lambda\|z\|_2^2\}$$

Explication

La formulation Ridge ajoute au résidu quadratique une pénalité λ∥z∥22\lambda\|z\|_2^2, avec λ>0\lambda>0. Une pénalité en norme ℓ1\ell_1 caractérise plutôt le Lasso, tandis qu’un signe négatif ne régularise pas le problème de la manière requise.

Révisez avec les flashcards

Mémorisez les réponses avec 51 flashcards sur Régression linéaire Ridge.

Quelle est la forme du modèle linéaire multiple ?

Yj=β0+β1xj,1+⋯+βpxj,p+εjY_j=\beta_0+\beta_1x_{j,1}+\cdots+\beta_px_{j,p}+\varepsilon_j

Quelles sont les propriétés des erreurs dans le modèle linéaire multiple ?

Elles sont centrées, indépendantes, identiquement distribuées avec variance σ2\sigma^2.

Comment s'écrit le modèle linéaire sous forme vectorielle ?

Y=Xβ+εY=X\beta+\varepsilon avec une matrice augmentée d'une colonne de 1.

Voir les flashcards →

Approfondir avec la fiche

Consultez la fiche de révision complète sur Régression linéaire Ridge.

Voir la fiche →

Cours similaires

Crée tes propres QCM

Importe ton cours et l'IA génère des QCM avec corrections en 30 secondes.

Générateur de QCM