★ À maîtriser
📌 Un tenseur ne construit le graphe nécessaire aux gradients que si son champ requires_grad vaut True, et le résultat d’une opération possède ce champ à True dès qu’un de ses opérandes le possède.
Compléments
📌 Seuls les tenseurs de type flottant peuvent demander le calcul de gradients dans PyTorch.
📌 La méthode detach() crée un tenseur partageant les données mais déconnecté du graphe courant, ce qui empêche la propagation des gradients au-delà de cette variable.
Opérations → graphe dynamique → gradients
★ À maîtriser
📐 Formule — Dans un MLP, chaque couche calcule .
📌 Une activation linéaire rend la composition de toutes les couches affine, même si le réseau comporte un nombre quelconque de couches cachées.
Compléments
Activation linéaire : affine ; activation non linéaire : expressivité
★ À maîtriser
📐 Formule — La dérivée de la fonction sigmoïde vérifie et satisfait .
Compléments
📌 La ReLU a une dérivée égale à 0 si son entrée est négative et à 1 si son entrée est positive, tandis qu’une leaky ReLU conserve une petite pente positive pour les entrées négatives.
Petites dérivées répétées → gradient qui s’annule
★ À maîtriser
📐 Formule — Pour une fonction cible f, un réseau peut construire tel que .
📌 L’erreur d’un modèle profond se décompose en erreur d’approximation, erreur d’estimation et erreur d’optimisation.
Compléments
Approximation théorique ≠ optimisation pratique
★ À maîtriser
Une régression linéaire utilise une activation de sortie linéaire, tandis qu’une régression logistique utilise une activation sigmoïde.
Pour une classification binaire, la sortie utilise une activation logistique, tandis que pour une classification multiclasses elle utilise une activation softmax.
La MSE et la MAE sont conceptuellement inadaptées à la classification, car elles traitent les indices de classes comme des valeurs numériques ordonnées.
Compléments
📐 Formule — La perte d’erreur quadratique moyenne est et la perte absolue moyenne est .
Régression : valeur ; classification : probabilité
★ À maîtriser
📐 Formule — La probabilité softmax de la classe i est .
📌 Une prédiction soft-label est un vecteur de probabilités de taille C, tandis qu’un hard-label est l’indice de la classe ayant la probabilité maximale.
📐 Formule — L’entropie croisée de deux distributions p et q est avec la convention .
Compléments
📌 Pour stabiliser numériquement la softmax, on soustrait le maximum des logits avant l’exponentiation, ce qui ne change pas les probabilités finales.
Logits → softmax → distribution de classes
★ À maîtriser
📐 Formule — Pour l’exemple donné, avec 6 variables, 3, 5 et 4 unités cachées et 3 classes, le réseau possède paramètres entraînables.
Compléments
Entrée → couches cachées → sortie
★ À maîtriser
📌 nn.CrossEntropyLoss attend des logits bruts non normalisés en entrée et des indices entiers de classes comme cibles, car elle applique LogSoftmax en interne.
📌 Appliquer manuellement une softmax avant nn.CrossEntropyLoss est une erreur courante qui dégrade l’apprentissage du modèle.
Compléments
CrossEntropyLoss : logits bruts, pas probabilités
Activations et usages
| Activation | Propriété | Usage ou risque |
|---|---|---|
| Linéaire | Composition affine | Régression |
| Sigmoïde / tanh | Dérivée bornée | Disparition des gradients |
| ReLU | Dérivée 0 ou 1 | Réseaux profonds, unités mortes |
| Softmax | Distribution de probabilités | Classification multiclasses |
Teste tes connaissances sur MLP, gradients et fonctions de perte avec 11 questions à choix multiples et corrections détaillées.
1. Quel mécanisme décrit le mieux le fonctionnement d’Autograd lors du calcul des dérivées de tenseurs ?
2. Un tenseur intervient dans une opération avec un autre tenseur dont . Quelle valeur prend le champ du résultat de cette opération ?
Mémorisez les concepts clés de MLP, gradients et fonctions de perte avec 11 flashcards interactives.
Qu'est-ce qu'Autograd selon Paszke et al., 2017 ?
Autograd construit dynamiquement le graphe des opérations tensorielles pour calculer automatiquement les gradients.
Que fait Tensor.backward() dans PyTorch ?
Il calcule les gradients et les accumule dans le champ grad des tenseurs feuilles.
Qu'est-ce qu'un perceptron multicouche ?
Une cascade de transformations affines suivies de fonctions d’activation.
Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.
Générateur de fiches