Fiche de révision : Régression linéaire Ridge

Plan du Cours

  1. Modèle linéaire et estimateur MCO
  2. Limites des moindres carrés
  3. Centrage, réduction et normes
  4. Principe de la régularisation Ridge
  5. Estimateur Ridge et propriétés
  6. Choix de la pénalité
  7. Calcul par décomposition SVD
  8. Mise en œuvre et interprétation

1. Modèle linéaire et estimateur MCO

Notions clés & Définitions

  • Modèle linéaire multiple : Le modèle linéaire multiple relie une variable réponse aux variables explicatives par Yj=β0+β1xj,1+⋯+βpxj,p+εjY_j=\beta_0+\beta_1x_{j,1}+\cdots+\beta_px_{j,p}+\varepsilon_j, où les erreurs sont centrées, indépendantes, de même loi et de variance σ2\sigma^2.
  • Estimateur MCO : L’estimateur des moindres carrés ordinaires minimise la somme des carrés des résidus selon β^MCO=arg⁡min⁡z∥Y−Xz∥2\hat\beta_{MCO}=\arg\min_z\|Y-Xz\|^2.

Points essentiels

📐 Formule — Sous forme vectorielle, le modèle linéaire s’écrit Y=Xβ+εY=X\beta+\varepsilon, avec une matrice augmentée d’une colonne de 1 pour intégrer la constante.

📐 Formule — Si XTXX^TX est inversible, l’estimateur MCO vaut β^MCO=(XTX)−1XTY\hat\beta_{MCO}=(X^TX)^{-1}X^TY.

2. Limites des moindres carrés

★ À maîtriser

  • L’estimateur MCO est sans biais et possède, parmi les estimateurs linéaires sans biais, la variance minimale.

📐 Formule — La variance de l’estimateur MCO est Var⁡(β^MCO)=σ2(XTX)−1\operatorname{Var}(\hat\beta_{MCO})=\sigma^2(X^TX)^{-1}.

  • Une forte colinéarité ou multicolinéarité entre les régresseurs peut rendre importante la variance de l’estimateur MCO et dégrader les prévisions.

Compléments

  • Dans le jeu de données cigarette, la corrélation entre le taux de goudron et le taux de nicotine vaut 0,96.

Astuce mémo

Colinéarité → variance élevée → prévisions instables

3. Centrage, réduction et normes

★ À maîtriser

📐 Formule — Pour des variables centrées et réduites, les normes utilisées sont ∥β∥1=∑j=1p∣βj∣\|\beta\|_1=\sum_{j=1}^p|\beta_j| et ∥β∥2=∑j=1pβj2\|\beta\|_2=\sqrt{\sum_{j=1}^p\beta_j^2}.

📌 Dans la suite du cours, les variables explicatives sont centrées et réduites et la variable réponse est centrée, de sorte que la constante n’est pas modélisée.

Compléments

📌 Lorsque les variables explicatives sont centrées, la constante MCO est égale à la moyenne de la réponse et l’estimation des pentes se calcule sans terme de centrage supplémentaire.

4. Principe de la régularisation Ridge

Notions clés & Définitions

  • Régression Ridge : Hoerl et Kennard, Ridge regression : applications to nonorthogonal problems, 1970 — La régression Ridge ajoute au critère des moindres carrés une contrainte sur la norme euclidienne des coefficients, selon β^Ridge=arg⁡min⁡z∥Y−Xz∥22sous∥z∥22≤t\hat\beta_{Ridge}=\arg\min_z\|Y-Xz\|_2^2\quad\text{sous}\quad\|z\|_2^2\le t.

★ À maîtriser

📌 Si le seuil t dépasse ∥β^MCO∥22\|\hat\beta_{MCO}\|_2^2, l’estimateur Ridge coïncide avec l’estimateur MCO, tandis que t=0 donne un estimateur nul.

Compléments

  • La régularisation Ridge réduit les plages de valeurs des coefficients estimés afin de limiter leur dépendance aux données.

Astuce mémo

MCO sans contrainte, Ridge avec contrainte

5. Estimateur Ridge et propriétés

Points essentiels

📐 Formule — La formulation pénalisée de Ridge est β^λ=arg⁡min⁡z{∥Y−Xz∥22+λ∥z∥22}\hat\beta_\lambda=\arg\min_z\{\|Y-Xz\|_2^2+\lambda\|z\|_2^2\} avec λ>0\lambda>0.

📐 Formule — L’estimateur Ridge possède la solution explicite β^λ=(XTX+λIp)−1XTY\hat\beta_\lambda=(X^TX+\lambda I_p)^{-1}X^TY.

📌 Même lorsque XTXX^TX n’est pas inversible, la matrice XTX+λIpX^TX+\lambda I_p est inversible pour λ>0\lambda>0, ce qui garantit l’existence de l’estimateur Ridge.

📐 Formule — L’estimateur Ridge est biaisé avec E(β^λ)=(XTX+λIp)−1XTXβE(\hat\beta_\lambda)=(X^TX+\lambda I_p)^{-1}X^TX\beta, mais sa variance est inférieure à celle de MCO lorsque celui-ci existe.

Astuce mémo

Biais accru, variance réduite

6. Choix de la pénalité

★ À maîtriser

📐 Formule — Le critère de validation croisée généralisée est GCV(λ)=∥Y−A(λ)Y∥2(trace⁡(In−A(λ)))2/nGCV(\lambda)=\frac{\|Y-A(\lambda)Y\|^2}{(\operatorname{trace}(I_n-A(\lambda)))^2/n} avec A(λ)=X(XTX+λIp)−1XTA(\lambda)=X(X^TX+\lambda I_p)^{-1}X^T. — Golub et al., Generalized cross-validation as a method for choosing a good ridge parameter, 1979

  • La pénalité optimale est choisie en évaluant GCV sur une grille λ1,…,λq\lambda_1,\ldots,\lambda_q puis en retenant la valeur qui minimise ce critère.

Compléments

  • Dans le jeu de données cigarette, les erreurs de prévision sont de 1,312 pour le modèle complet, 1,155 pour le modèle réduit et 1,302 pour Ridge.

Astuce mémo

Valeurs de λ → GCV → λ optimal

7. Calcul par décomposition SVD

Notions clés & Définitions

  • Décomposition SVD : La décomposition en valeurs singulières écrit la matrice X sous la forme X=UDVTX=UDV^T, où U possède des colonnes orthonormées, D est diagonale et V est orthogonale.

★ À maîtriser

📐 Formule — Avec la SVD, l’inverse nécessaire est Sλ−1=V(D2+λIp)−1VTS_\lambda^{-1}=V(D^2+\lambda I_p)^{-1}V^T, ce qui revient à inverser une matrice diagonale.

Compléments

📐 Formule — La décomposition SVD donne XTX=VD2VTX^TX=VD^2V^T, de sorte que les valeurs diagonales de D sont les racines carrées des valeurs propres de XTXX^TX.

📐 Formule — La matrice de lissage s’écrit A(λ)=UΔλUTA(\lambda)=U\Delta_\lambda U^T avec Δλ=diag⁡(d12d12+λ,…,dp2dp2+λ)\Delta_\lambda=\operatorname{diag}\left(\frac{d_1^2}{d_1^2+\lambda},\ldots,\frac{d_p^2}{d_p^2+\lambda}\right).

Astuce mémo

SVD → diagonale → GCV rapide

8. Mise en œuvre et interprétation

Points essentiels

📐 Formule — Pour revenir aux variables originales, les coefficients Ridge vérifient β^jridge=α^jridgesj\hat\beta^{ridge}_j=\hat\alpha^{ridge}_js_j et β^0ridge=mY−∑j=1pα^jridgemjsj\hat\beta^{ridge}_0=m_Y-\sum_{j=1}^p\hat\alpha^{ridge}_j\frac{m_j}{s_j}.

  • La mise en œuvre pratique consiste à calculer les moyennes et écarts-types, centrer-réduire les variables, estimer Ridge sur ces données, puis transformer les coefficients obtenus vers les unités originales.

📌 La régression Ridge conserve tous les régresseurs, même fortement corrélés, tandis qu’une sélection de variables élimine certains régresseurs.

  • La régression Ridge fournit une solution lorsque le nombre de régresseurs est supérieur à la taille de l’échantillon, situation dans laquelle MCO ne fournit pas de solution unique.

Astuce mémo

Centrer-réduire → estimer → revenir aux unités originales

Tableaux de synthèse

Comparaison MCO et Ridge

PropriétéMCORidge
BiaisSans biaisBiaisé
VariancePeut être élevée en cas de colinéaritéRéduite par la pénalisation
VariablesEstimation non régulariséeToutes les variables sont conservées
Grande dimensionPeut ne pas avoir de solution uniqueReste calculable pour p supérieur à n

Teste tes connaissances

Teste tes connaissances sur Régression linéaire Ridge avec 23 questions à choix multiples et corrections détaillées.

1. Comment sélectionne-t-on une pénalité Ridge à l’aide de la validation croisée généralisée ?

2. Quelle contrainte caractérise la formulation contrainte de la régression Ridge ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Régression linéaire Ridge avec 51 flashcards interactives.

Quelle est la forme du modèle linéaire multiple ?

Yj=β0+β1xj,1+⋯+βpxj,p+εjY_j=\beta_0+\beta_1x_{j,1}+\cdots+\beta_px_{j,p}+\varepsilon_j

Quelles sont les propriétés des erreurs dans le modèle linéaire multiple ?

Elles sont centrées, indépendantes, identiquement distribuées avec variance σ2\sigma^2.

Comment s'écrit le modèle linéaire sous forme vectorielle ?

Y=Xβ+εY=X\beta+\varepsilon avec une matrice augmentée d'une colonne de 1.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches