★ À maîtriser
📐 Formule — Le modèle linéaire s’écrit , où X est la matrice des données de format n×p et β le vecteur des paramètres.
📐 Formule — Lorsque l’estimateur existe, l’estimateur des moindres carrés ordinaires est .
Compléments
★ À maîtriser
📐 Formule — La formulation pénalisée du Lasso consiste à minimiser avec λ strictement positif.
📌 La fonction objectif du Lasso est convexe mais non différentiable en zéro, et sa solution peut ne pas être unique.
📌 Pour λ=0, le Lasso donne la solution des moindres carrés ordinaires si elle existe, tandis que λ tendant vers l’infini conduit à .
Compléments
📌 Lorsque t est supérieur à , l’estimateur Lasso est égal à l’estimateur MCO, si ce dernier existe.
Lasso sélectionne par zéros, Ridge rétrécit sans sélectionner
★ À maîtriser
Dans les chemins de régularisation, les coefficients sont suivis lorsque λ varie : pour λ suffisamment grand, tous sont nuls, puis des variables entrent lorsque λ diminue.
L’algorithme Forward Stagewise commence avec tous les coefficients nuls et augmente progressivement la norme ℓ₁ jusqu’à dépasser la pénalité t. — Efron et al., 2004
À chaque itération du FSA, on calcule les corrélations ρₖ entre chaque régresseur et le résidu, on choisit j maximisant |ρₖ|, on ajoute j à E si nécessaire, on met à jour les coefficients de E de ε selon le signe des corrélations, puis on recalcule le résidu.
Compléments
Dans l’exemple des cigarettes, pour t inférieur à 3,65 seul le coefficient β̂TAR est non nul ; pour t supérieur à 3,65, β̂TN puis β̂Poids deviennent non nuls.
À l’arrêt du FSA sur les données cigarettes, on obtient β̂TAR=3,85, β̂TN=0,15, β̂Poids=0,08 et .
Corrélation → entrée dans E → mise à jour → nouveau résidu
★ À maîtriser
📐 Formule — Pour la coordonnée j, le résidu partiel est .
📐 Formule — Pour le Lasso, on définit puis on minimise .
📐 Formule — Le seuillage doux donne
Compléments
📐 Formule — Dans les MCO, la mise à jour de la coordonnée j est .
Résidu partiel → coefficient MCO → seuillage doux → convergence
Pour choisir t avec le FSA, on calcule les solutions pour une suite croissante de valeurs tⱼ telle que t_q≤|β̂MCO|₁, puis on retient la valeur minimisant l’erreur de prédiction estimée par validation croisée par blocs.
Pour choisir λ avec le CDA, on calcule les solutions pour λ₁>λ₂>⋯>λ_q, en initialisant la première à zéro puis chaque suivante avec la solution précédente, avant de retenir le λ minimisant l’erreur de validation croisée.
Validation croisée → paramètre minimisant l’erreur de prédiction
★ À maîtriser
📌 Pour 0≤α<1, le critère Elastic Net est strictement convexe et admet une solution unique, tandis que pour α=1 il correspond au Lasso, dont la solution peut ne pas être unique.
📌 Le cas α=0 correspond à la régression Ridge et le cas α=1 à la régression Lasso.
📐 Formule — Dans la descente de coordonnées Elastic Net, la mise à jour est avec .
Compléments
α = 0 Ridge, α = 1 Lasso
Comparaison des pénalisations
| Méthode | Pénalisation | Effet principal |
|---|---|---|
| Ridge | Norme ℓ₂ | Rétrécit les coefficients |
| Lasso | Norme ℓ₁ | Rétrécit et annule certains coefficients |
| Elastic Net | Combinaison ℓ₁-ℓ₂ | Combine sélection et stabilité face aux corrélations |
Teste tes connaissances sur Régression Lasso et Elastic Net avec 11 questions à choix multiples et corrections détaillées.
1. Quelle propriété décrit correctement le prétraitement des variables dans ce modèle linéaire ?
2. Lorsque est inversible, quelle expression donne l’estimateur des moindres carrés ordinaires ?
Mémorisez les concepts clés de Régression Lasso et Elastic Net avec 11 flashcards interactives.
Quelles conditions définissent les données centrées réduites pour les variables explicatives ?
Les variables explicatives ont moyenne nulle et variance unitaire.
Quelle est la formule de l'estimateur des moindres carrés ordinaires ?
Qu'impose la contrainte de l'estimateur Lasso ?
La norme doit être inférieure à un seuil .
Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.
Générateur de fiches