Fiche de révision : Évaluation des modèles de machine learning

Plan du Cours

  1. Découpage des données
  2. Validation croisée
  3. Biais variance et régularisation
  4. Métriques de régression
  5. Métriques de classification
  6. Évaluation du classifieur
  7. Réglage des hyperparamètres
  8. Prévention des fuites et imputation
  9. Mise à l’échelle et encodage
  10. Autres techniques de caractéristiques

1. Découpage des données

Notions clés & Définitions

  • Jeu d’entraînement : Échantillon de données utilisé pour ajuster le modèle, qui apprend directement ses paramètres à partir de ces données.
  • Jeu de validation : Le jeu de validation fournit une évaluation non biaisée d’un modèle ajusté sur le jeu d’entraînement et sert à régler ses hyperparamètres sans que le modèle apprenne directement ses données.
  • Jeu de test : Le jeu de test fournit l’évaluation finale et non biaisée d’un modèle complètement entraîné, sert de référence pour comparer les modèles et n’est généralement utilisé qu’une fois.

Points essentiels

📌 Le ratio entre les jeux d’entraînement, de validation et de test dépend du nombre total d’échantillons, du modèle utilisé et du nombre d’hyperparamètres à régler, avec un partage courant de 80/20 ou 70/30 pour l’entraînement et le test.

Astuce mémo

Entraînement apprend, validation règle, test juge.

2. Validation croisée

Notions clés & Définitions

  • Validation croisée k-fold : La validation croisée k-fold divise les données en k sous-ensembles, utilise successivement chaque sous-ensemble comme validation et les k−1 autres comme entraînement, puis moyenne les erreurs.
  • Validation croisée stratifiée : Forme de validation croisée qui forme des sous-ensembles contenant approximativement les mêmes proportions de classes cibles que l’ensemble complet, ou la même moyenne de réponse en régression.
  • Validation leave-P-out : La validation leave-P-out retire p observations pour la validation, entraîne le modèle sur les n−p observations restantes et répète cette opération pour toutes les combinaisons possibles.

★ À maîtriser

  • La validation croisée divise les données en plusieurs sous-ensembles, entraîne et valide le modèle sur des partitions différentes, puis moyenne les erreurs obtenues.

Compléments

  • Les valeurs k = 5 ou k = 10 sont généralement privilégiées en validation croisée k-fold, sans être obligatoires.

Astuce mémo

Découper, entraîner, valider, moyenner.

3. Biais variance et régularisation

Notions clés & Définitions

  • Régularisation L2 : La régularisation L2 ajoute une pénalité proportionnelle à la somme des carrés des paramètres afin de réduire le surajustement, mais une valeur de λ trop élevée peut provoquer un sous-ajustement.
  • Courbe d’apprentissage : Graphique qui compare les performances sur les données d’entraînement et de test lorsque le nombre d’exemples d’entraînement varie.

★ À maîtriser

📌 Le sous-ajustement correspond à un modèle trop simple, de biais élevé, qui ne capture pas les tendances des données, tandis que le surajustement correspond à un modèle trop complexe, de variance élevée, qui apprend le bruit d’entraînement.

📌 Un biais élevé se manifeste par des erreurs d’entraînement et de test toutes deux élevées et proches, tandis qu’une variance élevée se manifeste par une faible erreur d’entraînement et une erreur de test beaucoup plus élevée.

Compléments

  • Pour corriger un biais élevé, on peut:

    • Complexifier le modèle
    • Ajouter des variables
    • Choisir un modèle mieux adapté aux données
    • Entraîner le modèle plus longtemps
  • Pour corriger une variance élevée, on peut:

    • Obtenir davantage de données
    • Utiliser la régularisation
    • Choisir un modèle mieux adapté

📐 Formule — Une hypothèse polynomiale d’ordre 5 s’écrit hθ(x)=θ0+θ1x+θ2x2+θ3x3+θ4x4+θ5x5h_{\theta}(x)=\theta_0+\theta_1x+\theta_2x^2+\theta_3x^3+\theta_4x^4+\theta_5x^5.

Astuce mémo

Biais élevé : modèle trop simple ; variance élevée : modèle trop complexe.

4. Métriques de régression

Notions clés & Définitions

  • Coefficient de détermination : Le coefficient R² mesure la proportion de variance de la variable cible expliquée par les variables prédictives ; une valeur de 0,80 signifie que 80 % de la variation est expliquée par le modèle.

★ À maîtriser

📐 Formule — L’erreur quadratique moyenne mesure la moyenne des erreurs au carré selon MSE=1m∑i=1m(y^i−yi)2\mathsf{MSE}=\frac{1}{m}\sum_{i=1}^{m}(\hat{y}_i-y_i)^2 et pénalise fortement les grandes erreurs.

📐 Formule — La RMSE est la racine carrée de la MSE et exprime l’erreur dans la même unité que la variable cible selon RMSE=1m∑i=1m(y^i−yi)2\mathsf{RMSE}=\sqrt{\frac{1}{m}\sum_{i=1}^{m}(\hat{y}_i-y_i)^2}.

📐 Formule — L’erreur absolue moyenne calcule la moyenne des distances absolues entre les valeurs prédites et les valeurs cibles selon MAE=1m∑i=1m∣y^i−yi∣\mathsf{MAE}=\frac{1}{m}\sum_{i=1}^{m}|\hat{y}_i-y_i| et résiste mieux aux valeurs aberrantes que la MSE.

Compléments

📐 Formule — Le R² ajusté tient compte du nombre de prédicteurs et ne croît que si l’ajout d’une variable améliore suffisamment le modèle selon Rajusteˊ2=1−(1−R2)(m−1)m−p−1R^2_{ajusté}=1-\frac{(1-R^2)(m-1)}{m-p-1}.

5. Métriques de classification

Notions clés & Définitions

  • Courbe ROC : Représentation du taux de vrais positifs en fonction du taux de faux positifs pour différents seuils de décision d’un classifieur binaire.
  • AUC : Aire sous la courbe ROC, comprise entre 0 et 1, qui agrège la performance d’un classifieur binaire sur tous les seuils possibles.

★ À maîtriser

📌 Dans une matrice de confusion, les éléments diagonaux correspondent aux prédictions correctes, tandis que les éléments hors diagonale correspondent aux classifications incorrectes.

📐 Formule — L’accuracy est la proportion de prédictions correctes selon Accuracy=TP+TNTP+TN+FP+FN\mathsf{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN}.

📐 Formule — La precision est la proportion d’observations réellement positives parmi celles prédites positives selon Precision=TPTP+FP\mathsf{Precision}=\frac{TP}{TP+FP}.

📐 Formule — Le recall est la proportion d’observations positives correctement prédites selon Recall=TPTP+FN\mathsf{Recall}=\frac{TP}{TP+FN}.

📐 Formule — Le score F1 est la moyenne harmonique de la precision et du recall selon F1=2Precision⋅RecallPrecision+Recall\mathsf{F1}=2\frac{\mathsf{Precision}\cdot\mathsf{Recall}}{\mathsf{Precision}+\mathsf{Recall}}.

Compléments

📐 Formule — La sensibilité, ou recall ou taux de vrais positifs, se calcule par Sensibiliteˊ=TPTP+FN\mathsf{Sensibilité}=\frac{TP}{TP+FN}.

📐 Formule — La spécificité, ou taux de vrais négatifs, se calcule par Speˊcificiteˊ=TNTN+FP\mathsf{Spécificité}=\frac{TN}{TN+FP}.

Astuce mémo

Precision mesure la fiabilité des positifs, recall la détection des positifs.

6. Évaluation du classifieur

★ À maîtriser

  • L’évaluation du modèle de cancer du sein utilise une régression logistique entraînée sur 70 % des données et testée sur 30 % avec random_state=1.

  • La matrice de confusion obtenue sur le jeu de test est (5766102)\begin{pmatrix}57&6\\6&102\end{pmatrix}.

  • L’exactitude du modèle sur le jeu de test est de 0.935672514619883.

  • Pour tracer la courbe ROC et calculer l’AUC, il faut utiliser les probabilités produites par predict_proba plutôt que les classes finales produites par predict.

Compléments

  • Les rappels des deux classes sont respectivement 0.92063492 et 0.94444444.

  • Les précisions des deux classes sont respectivement 0.90625 et 0.95327103, et leurs scores F1 sont respectivement 0.91338583 et 0.94883721.

7. Réglage des hyperparamètres

Notions clés & Définitions

  • Réglage des hyperparamètres : un problème d’optimisation visant à trouver la combinaison de valeurs qui minimise une fonction comme la perte ou maximise une fonction comme l’exactitude

★ À maîtriser

📌 Les hyperparamètres sont fixés par l’utilisateur avant l’entraînement, tandis que les paramètres du modèle sont appris pendant l’entraînement.

  • La recherche en grille teste systématiquement des ensembles prédéfinis de valeurs d’hyperparamètres selon une grille, généralement avec une validation croisée.

📌 Random Search échantillonne aléatoirement un nombre fixé de combinaisons avec n_iter et est particulièrement recommandé lorsque l’espace comporte plus de trois dimensions.

Compléments

  • Dans l’exemple Ridge, six valeurs d’alpha sont testées avec cinq plis de validation croisée, soit 30 ajustements, et la meilleure valeur est alpha=0.001.

  • Dans l’exemple Iris, RandomizedSearchCV teste 50 itérations et obtient une exactitude de 0.98 avec une pénalisation L2 et C=2.7825594022071245.

Astuce mémo

Grid Search quadrille les valeurs ; Random Search explore aléatoirement l’espace.

8. Prévention des fuites et imputation

Notions clés & Définitions

  • Fuite de données : une erreur qui consiste à partager accidentellement des informations entre les jeux d’entraînement et de test, ce qui peut surestimer les performances du modèle

★ À maîtriser

📌 Tout préprocesseur doit être ajusté uniquement sur le jeu d’entraînement, puis appliqué au jeu de test avec sa transformation déjà ajustée.

  • L’imputation des valeurs manquantes consiste à identifier les valeurs absentes, décider de conserver ou supprimer les lignes ou colonnes, puis appliquer la même transformation aux jeux d’entraînement et de test.

📌 Dans l’exemple, les valeurs manquantes de CreditHistory sont remplacées par 1, tandis que celles de LoanAmount et LoanAmountTerm sont remplacées par la médiane.

Compléments

  • Le jeu de prêts contient 614 observations et 13 colonnes, puis il est séparé en 491 observations d’entraînement et 123 observations de test.

📌 Pour les variables catégorielles, les valeurs manquantes de Married, Gender et Dependents sont remplacées par la modalité la plus fréquente, tandis que SelfEmployed reçoit la valeur constante « UNK ».

Astuce mémo

Prétraiter avec le jeu de test → fuite de données → performance réelle surestimée.

9. Mise à l’échelle et encodage

Notions clés & Définitions

  • Mise à l’échelle : transforme les caractéristiques continues afin de les rendre comparables sur une même plage
  • Label Encoding : convertit les modalités catégorielles en valeurs entières comprises entre 0 et n_classes-1
  • One-Hot Encoding : crée une colonne binaire pour chaque catégorie afin de représenter les variables catégorielles sans leur attribuer d’ordre

★ À maîtriser

📐 Formule — La transformation MinMaxScaler est x′=x−min⁡(x)max⁡(x)−min⁡(x)x' = \frac{x-\min(x)}{\max(x)-\min(x)} et ramène les valeurs entre 0 et 1.

📌 Une variable nominale décrit des catégories sans ordre, une variable dichotomique possède deux modalités et une variable ordinale possède des catégories pouvant être classées.

Compléments

📌 Avec OneHotEncoder, drop peut supprimer une catégorie pour éviter la colinéarité parfaite et handle_unknown='ignore' encode une catégorie inconnue par des zéros lors de la transformation.

Astuce mémo

Label Encoding ordonne artificiellement ; One-Hot Encoding sépare les catégories.

10. Autres techniques de caractéristiques

Notions clés & Définitions

  • Transformation logarithmique : réduit l’asymétrie, diminue l’effet des valeurs aberrantes et rapproche souvent la distribution d’une distribution normale

★ À maîtriser

📌 La détection univariée recherche des valeurs extrêmes sur une variable, tandis que la détection multivariée recherche des combinaisons inhabituelles sur plusieurs variables.

  • L’erreur de Minkowski réduit l’influence des valeurs aberrantes en élevant l’erreur individuelle à une puissance inférieure à 2, par exemple 1.5, au lieu de la mettre au carré comme dans l’erreur quadratique moyenne.

📌 Le binning à intervalles égaux utilise des frontières fixes, tandis que le binning par quantiles crée des intervalles contenant le même nombre de points.

Compléments

📌 Le binning par quantiles est préférable pour des données asymétriques, tandis que le binning à intervalles égaux convient à de nombreuses distributions.

📌 Une transformation logarithmique ne peut être appliquée directement qu’à des valeurs positives ; ajouter 1 aux données peut garantir une sortie positive.

Tableaux de synthèse

Découpage des données

JeuRôleInfluence sur le modèle
EntraînementAjuster les paramètresDirecte
ValidationRégler les hyperparamètresIndirecte
TestÉvaluer le modèle finalAucune avant l’évaluation

Recherche d’hyperparamètres

MéthodePrincipeUsage privilégié
Grid SearchTeste toutes les combinaisons d’une grilleEspace de recherche limité
Random SearchÉchantillonne aléatoirement un nombre fixé de combinaisonsEspace de plus de trois dimensions

Teste tes connaissances

Teste tes connaissances sur Évaluation des modèles de machine learning avec 11 questions à choix multiples et corrections détaillées.

1. Quel ensemble de données sert directement à ajuster les paramètres appris par un modèle ?

2. Après l’entraînement complet d’un modèle, quel ensemble fournit son évaluation finale non biaisée et sert à comparer plusieurs modèles ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Évaluation des modèles de machine learning avec 11 flashcards interactives.

Qu'est-ce que le jeu d'entraînement en apprentissage automatique ?

C'est l'échantillon de données utilisé pour ajuster le modèle.

Quel est le rôle du jeu de validation dans l'entraînement d'un modèle ?

Il sert à régler les hyperparamètres sans que le modèle apprenne ses données.

Que fait la validation croisée avec les données ?

Elle divise les données en plusieurs sous-ensembles.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches