📌 Le ratio entre les jeux d’entraînement, de validation et de test dépend du nombre total d’échantillons, du modèle utilisé et du nombre d’hyperparamètres à régler, avec un partage courant de 80/20 ou 70/30 pour l’entraînement et le test.
Entraînement apprend, validation règle, test juge.
★ À maîtriser
Compléments
Découper, entraîner, valider, moyenner.
★ À maîtriser
📌 Le sous-ajustement correspond à un modèle trop simple, de biais élevé, qui ne capture pas les tendances des données, tandis que le surajustement correspond à un modèle trop complexe, de variance élevée, qui apprend le bruit d’entraînement.
📌 Un biais élevé se manifeste par des erreurs d’entraînement et de test toutes deux élevées et proches, tandis qu’une variance élevée se manifeste par une faible erreur d’entraînement et une erreur de test beaucoup plus élevée.
Compléments
Pour corriger un biais élevé, on peut:
Pour corriger une variance élevée, on peut:
📐 Formule — Une hypothèse polynomiale d’ordre 5 s’écrit .
Biais élevé : modèle trop simple ; variance élevée : modèle trop complexe.
★ À maîtriser
📐 Formule — L’erreur quadratique moyenne mesure la moyenne des erreurs au carré selon et pénalise fortement les grandes erreurs.
📐 Formule — La RMSE est la racine carrée de la MSE et exprime l’erreur dans la même unité que la variable cible selon .
📐 Formule — L’erreur absolue moyenne calcule la moyenne des distances absolues entre les valeurs prédites et les valeurs cibles selon et résiste mieux aux valeurs aberrantes que la MSE.
Compléments
📐 Formule — Le R² ajusté tient compte du nombre de prédicteurs et ne croît que si l’ajout d’une variable améliore suffisamment le modèle selon .
★ À maîtriser
📌 Dans une matrice de confusion, les éléments diagonaux correspondent aux prédictions correctes, tandis que les éléments hors diagonale correspondent aux classifications incorrectes.
📐 Formule — L’accuracy est la proportion de prédictions correctes selon .
📐 Formule — La precision est la proportion d’observations réellement positives parmi celles prédites positives selon .
📐 Formule — Le recall est la proportion d’observations positives correctement prédites selon .
📐 Formule — Le score F1 est la moyenne harmonique de la precision et du recall selon .
Compléments
📐 Formule — La sensibilité, ou recall ou taux de vrais positifs, se calcule par .
📐 Formule — La spécificité, ou taux de vrais négatifs, se calcule par .
Precision mesure la fiabilité des positifs, recall la détection des positifs.
★ À maîtriser
L’évaluation du modèle de cancer du sein utilise une régression logistique entraînée sur 70 % des données et testée sur 30 % avec random_state=1.
La matrice de confusion obtenue sur le jeu de test est .
L’exactitude du modèle sur le jeu de test est de 0.935672514619883.
Pour tracer la courbe ROC et calculer l’AUC, il faut utiliser les probabilités produites par predict_proba plutôt que les classes finales produites par predict.
Compléments
Les rappels des deux classes sont respectivement 0.92063492 et 0.94444444.
Les précisions des deux classes sont respectivement 0.90625 et 0.95327103, et leurs scores F1 sont respectivement 0.91338583 et 0.94883721.
★ À maîtriser
📌 Les hyperparamètres sont fixés par l’utilisateur avant l’entraînement, tandis que les paramètres du modèle sont appris pendant l’entraînement.
📌 Random Search échantillonne aléatoirement un nombre fixé de combinaisons avec n_iter et est particulièrement recommandé lorsque l’espace comporte plus de trois dimensions.
Compléments
Dans l’exemple Ridge, six valeurs d’alpha sont testées avec cinq plis de validation croisée, soit 30 ajustements, et la meilleure valeur est alpha=0.001.
Dans l’exemple Iris, RandomizedSearchCV teste 50 itérations et obtient une exactitude de 0.98 avec une pénalisation L2 et C=2.7825594022071245.
Grid Search quadrille les valeurs ; Random Search explore aléatoirement l’espace.
★ À maîtriser
📌 Tout préprocesseur doit être ajusté uniquement sur le jeu d’entraînement, puis appliqué au jeu de test avec sa transformation déjà ajustée.
📌 Dans l’exemple, les valeurs manquantes de CreditHistory sont remplacées par 1, tandis que celles de LoanAmount et LoanAmountTerm sont remplacées par la médiane.
Compléments
📌 Pour les variables catégorielles, les valeurs manquantes de Married, Gender et Dependents sont remplacées par la modalité la plus fréquente, tandis que SelfEmployed reçoit la valeur constante « UNK ».
Prétraiter avec le jeu de test → fuite de données → performance réelle surestimée.
★ À maîtriser
📐 Formule — La transformation MinMaxScaler est et ramène les valeurs entre 0 et 1.
📌 Une variable nominale décrit des catégories sans ordre, une variable dichotomique possède deux modalités et une variable ordinale possède des catégories pouvant être classées.
Compléments
📌 Avec OneHotEncoder, drop peut supprimer une catégorie pour éviter la colinéarité parfaite et handle_unknown='ignore' encode une catégorie inconnue par des zéros lors de la transformation.
Label Encoding ordonne artificiellement ; One-Hot Encoding sépare les catégories.
★ À maîtriser
📌 La détection univariée recherche des valeurs extrêmes sur une variable, tandis que la détection multivariée recherche des combinaisons inhabituelles sur plusieurs variables.
📌 Le binning à intervalles égaux utilise des frontières fixes, tandis que le binning par quantiles crée des intervalles contenant le même nombre de points.
Compléments
📌 Le binning par quantiles est préférable pour des données asymétriques, tandis que le binning à intervalles égaux convient à de nombreuses distributions.
📌 Une transformation logarithmique ne peut être appliquée directement qu’à des valeurs positives ; ajouter 1 aux données peut garantir une sortie positive.
| Jeu | Rôle | Influence sur le modèle |
|---|---|---|
| Entraînement | Ajuster les paramètres | Directe |
| Validation | Régler les hyperparamètres | Indirecte |
| Test | Évaluer le modèle final | Aucune avant l’évaluation |
| Méthode | Principe | Usage privilégié |
|---|---|---|
| Grid Search | Teste toutes les combinaisons d’une grille | Espace de recherche limité |
| Random Search | Échantillonne aléatoirement un nombre fixé de combinaisons | Espace de plus de trois dimensions |
Teste tes connaissances sur Évaluation des modèles de machine learning avec 11 questions à choix multiples et corrections détaillées.
1. Quel ensemble de données sert directement à ajuster les paramètres appris par un modèle ?
2. Après l’entraînement complet d’un modèle, quel ensemble fournit son évaluation finale non biaisée et sert à comparer plusieurs modèles ?
Mémorisez les concepts clés de Évaluation des modèles de machine learning avec 11 flashcards interactives.
Qu'est-ce que le jeu d'entraînement en apprentissage automatique ?
C'est l'échantillon de données utilisé pour ajuster le modèle.
Quel est le rôle du jeu de validation dans l'entraînement d'un modèle ?
Il sert à régler les hyperparamètres sans que le modèle apprenne ses données.
Que fait la validation croisée avec les données ?
Elle divise les données en plusieurs sous-ensembles.
Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.
Générateur de fiches