Fiche de révision : Régression Lasso et Elastic Net

Plan du Cours

  1. Données et modèle linéaire
  2. Principe de la régression Lasso
  3. Chemins et algorithme FSA
  4. Descente de coordonnées Lasso
  5. Choix du paramètre de régularisation
  6. Méthode Elastic Net

1. Données et modèle linéaire

Notions clés & Définitions

  • Modèle linéaire : S’écrit Y=Xβ+εY=X\beta+\varepsilon, où Y est le vecteur réponse, X la matrice des variables explicatives, β le vecteur des paramètres et ε le vecteur des erreurs.

★ À maîtriser

  • Les données comprennent n observations de p variables explicatives quantitatives et d’une variable réponse Y.

📐 Formule — Lorsque l’inverse existe, l’estimateur des moindres carrés ordinaires est β^MCO=(XTX)−1XTY\hat\beta_{MCO}=(X^TX)^{-1}X^TY.

Compléments

📌 Les variables explicatives sont centrées et réduites, avec 1n∑j=1nxj,k=0\frac{1}{n}\sum_{j=1}^{n}x_{j,k}=0 et 1n∑j=1nxj,k2=1\frac{1}{n}\sum_{j=1}^{n}x_{j,k}^{2}=1 pour tout k, tandis que Y est centrée.

2. Principe de la régression Lasso

Notions clés & Définitions

  • Estimateur Lasso : Tibshirani, 1996 — Minimise la somme des carrés des résidus sous la contrainte ∥z∥1≤t\|z\|_1\le t, où t est un réel strictement positif.

★ À maîtriser

📌 Lorsque t est supérieur à ∥β^MCO∥1\|\hat\beta_{MCO}\|_1, la solution Lasso coïncide avec l’estimateur MCO.

📌 Le Lasso peut mettre certaines composantes de l’estimateur exactement à zéro et réalise ainsi une sélection automatique des variables explicatives.

📐 Formule — La formulation pénalisée du Lasso consiste à minimiser Gλ(z)=∥Y−Xz∥22+λ∥z∥1G_\lambda(z)=\|Y-Xz\|_2^2+\lambda\|z\|_1 avec λ>0\lambda>0.

Compléments

📌 Pour λ = 0, on retrouve les moindres carrés ordinaires, tandis que lorsque λ tend vers l’infini, l’estimateur Lasso tend vers zéro et les coefficients sont davantage rétrécis lorsque λ augmente.

Astuce mémo

Lasso : coefficients rétrécis et variables sélectionnées ; Ridge : pas de sélection automatique.

3. Chemins et algorithme FSA

★ À maîtriser

  • Les chemins de régularisation décrivent l’évolution de chaque coefficient estimé lorsque λ varie : pour λ suffisamment grand, tous les coefficients sont nuls, puis des variables entrent dans le modèle lorsque λ diminue.

  • L’algorithme Forward Stagewise initialise tous les coefficients à zéro et l’ensemble actif E à vide, calcule les corrélations avec le résidu, sélectionne la corrélation absolue maximale, ajoute la variable à E si nécessaire, augmente les coefficients actifs d’un petit pas selon le signe de leur corrélation, puis recalcule le résidu jusqu’à dépasser la pénalité t. — Efron et al., 2004

Compléments

  • Dans l’exemple des cigarettes, pour une pénalité inférieure à 3,65 seul le coefficient associé à TAR est non nul ; au-delà de 3,65, TN puis Poids entrent dans le modèle.

  • À l’arrêt du FSA sur l’exemple des cigarettes, les coefficients valent β^TAR=3,85\hat\beta_{TAR}=3{,}85, β^TN=0,15\hat\beta_{TN}=0{,}15, β^Poids=0,08\hat\beta_{Poids}=0{,}08 et la norme L1 vaut 4,08.

Astuce mémo

Corrélation maximale → entrée dans E → mise à jour → nouveau résidu.

4. Descente de coordonnées Lasso

Notions clés & Définitions

  • Descente de coordonnées : Minimise successivement une fonction par rapport à une seule coordonnée, en maintenant les autres fixes, puis répète ces mises à jour jusqu’à convergence.

★ À maîtriser

📐 Formule — Pour le Lasso, en posant βj∗=XjTRjn\beta_j^*=\frac{X_j^TR_j}{n}, la mise à jour par seuillage doux est βj=βj∗(1−λ2n∣βj∗∣)+\beta_j=\beta_j^*\left(1-\frac{\lambda}{2n|\beta_j^*|}\right)_+.

📌 Le seuillage doux donne βj = 0 lorsque ∣βj∗∣≤λ2n|\beta_j^*|\le\frac{\lambda}{2n} ; sinon, il rapproche βj* de zéro de λ2n\frac{\lambda}{2n}.

  • L’algorithme CDA initialise β, calcule successivement chaque résidu partiel, obtient βj* par la mise à jour MCO, applique le seuillage doux, puis répète les passages sur les coordonnées jusqu’à convergence. — Friedman, Hastie et Tibshirani, 2010

Compléments

📐 Formule — Pour les MCO, avec le résidu partiel Rj=Y−∑k≠jXkβkR_j=Y-\sum_{k\ne j}X_k\beta_k, la mise à jour est βj←XjTRjn\beta_j\leftarrow\frac{X_j^TR_j}{n}.

Astuce mémo

Pénalité L1 non dérivable en zéro → seuillage doux → coefficients réduits ou annulés.

5. Choix du paramètre de régularisation

Points essentiels

  • Pour choisir t ou λ, on calcule les solutions pour une suite de paramètres, on estime l’erreur de prédiction par validation croisée par blocs, puis on retient le paramètre qui minimise cette erreur.

6. Méthode Elastic Net

Notions clés & Définitions

  • Estimateur Elastic Net : Zou et Hastie, 2005 — Minimise 12n∥Y−Xz∥22+λ(1−α2∥z∥22+α∥z∥1)\frac{1}{2n}\|Y-Xz\|_2^2+\lambda\left(\frac{1-\alpha}{2}\|z\|_2^2+\alpha\|z\|_1\right) avec λ>0\lambda>0 et α∈[0,1]\alpha\in[0{,}1].

★ À maîtriser

📌 Pour α = 0, Elastic Net correspond à Ridge, tandis que pour α = 1, il correspond au Lasso.

📐 Formule — La mise à jour Elastic Net par descente de coordonnées est βj=signe⁡(βj∗)(∣βj∗∣−αλ)+1+λ(1−α)\beta_j=\operatorname{signe}(\beta_j^*)\frac{(|\beta_j^*|-\alpha\lambda)_+}{1+\lambda(1-\alpha)}, où βj∗=XjTRj/n\beta_j^*=X_j^TR_j/n.

Compléments

📌 Le critère Elastic Net est convexe et, lorsque 0≤α<10\le\alpha<1, il est strictement convexe et admet donc une solution unique.

Astuce mémo

α = 0 donne Ridge ; α = 1 donne Lasso.

Tableaux de synthèse

Comparaison des pénalisations

MéthodePénalisationEffet principal
MCOAucuneEstimation non pénalisée
RidgeNorme L2Rétrécissement sans sélection exacte
LassoNorme L1Rétrécissement et sélection de variables
Elastic NetCombinaison L2 et L1Compromis Ridge-Lasso

Teste tes connaissances

Teste tes connaissances sur Régression Lasso et Elastic Net avec 18 questions à choix multiples et corrections détaillées.

1. Une équipe veut sélectionner λ\lambda pour obtenir les meilleures prédictions sur de nouvelles données : quel critère doit-elle privilégier ?

2. Quelle combinaison de pénalités définit l’estimateur Elastic Net ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Régression Lasso et Elastic Net avec 41 flashcards interactives.

Comment s'écrit le modèle linéaire ?

Le modèle linéaire s'écrit Y=Xβ+εY=X\beta+\varepsilon.

Que comprennent les données en régression linéaire ?

Elles comprennent n observations de p variables explicatives quantitatives et une variable réponse Y.

Quelle condition impose la centration des variables explicatives ?

La moyenne de chaque variable explicative est nulle, soit 1n∑j=1nxj,k=0\frac{1}{n}\sum_{j=1}^{n}x_{j,k}=0.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches