Fiche de révision : Régression Lasso et Elastic Net

Plan du Cours

  1. Données et modèle linéaire
  2. Principe de la régression Lasso
  3. Chemins et algorithme FSA
  4. Descente de coordonnées
  5. Choix de la régularisation
  6. Méthode Elastic Net

1. Données et modèle linéaire

Notions clés & Définitions

  • Données centrées réduites : Les variables explicatives sont centrées et réduites, avec 1n∑j=1nxj,k=0\frac{1}{n}\sum_{j=1}^n x_{j,k}=0 et 1n∑j=1nxj,k2=1\frac{1}{n}\sum_{j=1}^n x_{j,k}^2=1 pour tout k, tandis que la variable Y est centrée.

★ À maîtriser

📐 Formule — Le modèle linéaire s’écrit Y=Xβ+εY=X\beta+\varepsilon, où X est la matrice des données de format n×p et β le vecteur des paramètres.

📐 Formule — Lorsque l’estimateur existe, l’estimateur des moindres carrés ordinaires est β^MCO=(XTX)−1XTY\hat\beta_{MCO}=(X^TX)^{-1}X^TY.

Compléments

  • La matrice X est formée des colonnes X₁,…,Xₚ et vérifie XjTXj=nX_j^TX_j=n pour tout j lorsque les variables sont centrées et réduites.

2. Principe de la régression Lasso

Notions clés & Définitions

  • Estimateur Lasso : Tibshirani, 1996 — L’estimateur Lasso minimise la somme des carrés des résidus sous la contrainte ∥z∥1<t\|z\|_1<t, avec t strictement positif.

★ À maîtriser

📐 Formule — La formulation pénalisée du Lasso consiste à minimiser Gλ(z)=∥Y−Xz∥22+λ∥z∥1G_\lambda(z)=\|Y-Xz\|_2^2+\lambda\|z\|_1 avec λ strictement positif.

📌 La fonction objectif du Lasso est convexe mais non différentiable en zéro, et sa solution peut ne pas être unique.

📌 Pour λ=0, le Lasso donne la solution des moindres carrés ordinaires si elle existe, tandis que λ tendant vers l’infini conduit à β^Lasso=0\hat\beta_{Lasso}=0.

Compléments

📌 Lorsque t est supérieur à ∥β^MCO∥1\|\hat\beta_{MCO}\|_1, l’estimateur Lasso est égal à l’estimateur MCO, si ce dernier existe.

Astuce mémo

Lasso sélectionne par zéros, Ridge rétrécit sans sélectionner

3. Chemins et algorithme FSA

★ À maîtriser

  • Dans les chemins de régularisation, les coefficients sont suivis lorsque λ varie : pour λ suffisamment grand, tous sont nuls, puis des variables entrent lorsque λ diminue.

  • L’algorithme Forward Stagewise commence avec tous les coefficients nuls et augmente progressivement la norme ℓ₁ jusqu’à dépasser la pénalité t. — Efron et al., 2004

  • À chaque itération du FSA, on calcule les corrélations ρₖ entre chaque régresseur et le résidu, on choisit j maximisant |ρₖ|, on ajoute j à E si nécessaire, on met à jour les coefficients de E de ε selon le signe des corrélations, puis on recalcule le résidu.

Compléments

  • Dans l’exemple des cigarettes, pour t inférieur à 3,65 seul le coefficient β̂TAR est non nul ; pour t supérieur à 3,65, β̂TN puis β̂Poids deviennent non nuls.

  • À l’arrêt du FSA sur les données cigarettes, on obtient β̂TAR=3,85, β̂TN=0,15, β̂Poids=0,08 et ∥β^FSA∥1=4,08\|\hat\beta_{FSA}\|_1=4{,}08.

Astuce mémo

Corrélation → entrée dans E → mise à jour → nouveau résidu

4. Descente de coordonnées

Notions clés & Définitions

  • Descente de coordonnées : La descente de coordonnées minimise successivement une fonction par rapport à une seule coordonnée, en maintenant les autres fixes, puis répète ces mises à jour jusqu’à convergence.

★ À maîtriser

📐 Formule — Pour la coordonnée j, le résidu partiel est Rj=Y−∑k≠jXkβkR_j=Y-\sum_{k\ne j}X_k\beta_k.

📐 Formule — Pour le Lasso, on définit βj∗=XjTRjn\beta_j^*=\frac{X_j^TR_j}{n} puis on minimise Hλ(βj)=nβj2−2nβj∗βj+λ∣βj∣H_\lambda(\beta_j)=n\beta_j^2-2n\beta_j^*\beta_j+\lambda|\beta_j|.

📐 Formule — Le seuillage doux donne βj={βj∗−λ2n,βj∗>λ2n,0,∣βj∗∣≤λ2n,βj∗+λ2n,βj∗<−λ2n.\beta_j=\begin{cases}\beta_j^*-\frac{\lambda}{2n},&\beta_j^*>\frac{\lambda}{2n},\\0,&|\beta_j^*|\le\frac{\lambda}{2n},\beta_j^*+\frac{\lambda}{2n},&\beta_j^*<-\frac{\lambda}{2n}.\end{cases}

  • L’algorithme CDA initialise β, calcule pour chaque j le résidu partiel et βⱼ*, applique le seuillage doux, puis répète les passages sur les coordonnées jusqu’à convergence. — Friedman, Hastie et Tibshirani, 2010

Compléments

📐 Formule — Dans les MCO, la mise à jour de la coordonnée j est βj←XjTRjn\beta_j\leftarrow\frac{X_j^TR_j}{n}.

Astuce mémo

Résidu partiel → coefficient MCO → seuillage doux → convergence

5. Choix de la régularisation

Points essentiels

  • Pour choisir t avec le FSA, on calcule les solutions pour une suite croissante de valeurs tⱼ telle que t_q≤|β̂MCO|₁, puis on retient la valeur minimisant l’erreur de prédiction estimée par validation croisée par blocs.

  • Pour choisir λ avec le CDA, on calcule les solutions pour λ₁>λ₂>⋯>λ_q, en initialisant la première à zéro puis chaque suivante avec la solution précédente, avant de retenir le λ minimisant l’erreur de validation croisée.

Astuce mémo

Validation croisée → paramètre minimisant l’erreur de prédiction

6. Méthode Elastic Net

Notions clés & Définitions

  • Estimateur Elastic Net : Zou et Hastie, 2005 — L’estimateur Elastic Net minimise 12n∥Y−Xz∥22+λ(1−α2∥z∥22+α∥z∥1)\frac{1}{2n}\|Y-Xz\|_2^2+\lambda\left(\frac{1-\alpha}{2}\|z\|_2^2+\alpha\|z\|_1\right) avec λ>0 et α∈[0,1].

★ À maîtriser

📌 Pour 0≤α<1, le critère Elastic Net est strictement convexe et admet une solution unique, tandis que pour α=1 il correspond au Lasso, dont la solution peut ne pas être unique.

📌 Le cas α=0 correspond à la régression Ridge et le cas α=1 à la régression Lasso.

📐 Formule — Dans la descente de coordonnées Elastic Net, la mise à jour est βj=signe⁡(βj∗)(∣βj∗∣−αλ)+1+λ(1−α)\beta_j=\operatorname{signe}(\beta_j^*)\frac{(|\beta_j^*|-\alpha\lambda)_+}{1+\lambda(1-\alpha)} avec βj∗=XjTRjn\beta_j^*=\frac{X_j^TR_j}{n}.

Compléments

  • Elastic Net pallie le défaut majeur du Lasso lorsque certains régresseurs sont fortement corrélés.

Astuce mémo

α = 0 Ridge, α = 1 Lasso

Tableaux de synthèse

Comparaison des pénalisations

MéthodePénalisationEffet principal
RidgeNorme ℓ₂Rétrécit les coefficients
LassoNorme ℓ₁Rétrécit et annule certains coefficients
Elastic NetCombinaison ℓ₁-ℓ₂Combine sélection et stabilité face aux corrélations

Teste tes connaissances

Teste tes connaissances sur Régression Lasso et Elastic Net avec 11 questions à choix multiples et corrections détaillées.

1. Quelle propriété décrit correctement le prétraitement des variables dans ce modèle linéaire ?

2. Lorsque XTXX^TX est inversible, quelle expression donne l’estimateur des moindres carrés ordinaires ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Régression Lasso et Elastic Net avec 11 flashcards interactives.

Quelles conditions définissent les données centrées réduites pour les variables explicatives ?

Les variables explicatives ont moyenne nulle et variance unitaire.

Quelle est la formule de l'estimateur des moindres carrés ordinaires ?

β^MCO=(XTX)−1XTY\hat\beta_{MCO}=(X^TX)^{-1}X^TY

Qu'impose la contrainte de l'estimateur Lasso ?

La norme ∥z∥1\|z\|_1 doit être inférieure à un seuil t>0t>0.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches