Fiche de révision : Bases des réseaux de neurones

Plan du Cours

  1. Unités logiques à seuil
  2. Perceptron et séparation linéaire
  3. De l’analyse discriminante à la régression
  4. Dérivées et gradient
  5. Descente de gradient stochastique
  6. Couches et perceptron multicouche
  7. Différentiation automatique et rétropropagation

1. Unités logiques à seuil

★ À maîtriser

📐 Formule — Une unité logique à seuil calcule f(x)=1{∑iwixi+b≥0}f(x)=\mathbf{1}\left\{\sum_i w_i x_i+b\geq 0\right\}, où les poids pondèrent les entrées et le biais fixe le seuil. — McCulloch and Pitts, 1943

📐 Formule — Les portes logiques s’obtiennent par vote pondéré et seuillage : or⁡(x1,x2)=1{x1+x2−0.5≥0}\operatorname{or}(x_1,x_2)=\mathbf{1}\{x_1+x_2-0.5\geq0\}, and⁡(x1,x2)=1{x1+x2−1.5≥0}\operatorname{and}(x_1,x_2)=\mathbf{1}\{x_1+x_2-1.5\geq0\} et not⁡(x1)=1{−x1+0.5≥0}\operatorname{not}(x_1)=\mathbf{1}\{-x_1+0.5\geq0\}.

📌 Une fonction booléenne linéairement séparable peut être réalisée par une seule TLU, tandis que XOR ne peut pas l’être. — Minsky and Papert, 1969

Compléments

  • La composition de deux unités cachées et d’une unité de sortie suffit à calculer XOR, et la composition de TLU permet de construire toute fonction booléenne.

Astuce mémo

Le biais fixe le seuil, tandis que les poids votent pour les entrées

2. Perceptron et séparation linéaire

Notions clés & Définitions

  • Perceptron : Rosenblatt, 1957 — Unité à seuil dont les entrées sont réelles et dont les poids sont appris à partir des données.
  • Classifieur linéaire : Un classifieur linéaire sépare l’espace des entrées par l’hyperplan wTx+b=0w^Tx+b=0.

Points essentiels

📐 Formule — La règle de classification du perceptron s’écrit f(x)=sign⁡(wTx+b)f(x)=\operatorname{sign}(w^Tx+b), avec sign⁡(z)=1\operatorname{sign}(z)=1 si z≥0z\geq0 et 0 sinon.

Astuce mémo

Une droite sépare AND et OR, mais pas XOR

3. De l’analyse discriminante à la régression

Points essentiels

  • L’analyse discriminante linéaire suppose que les populations de classes sont gaussiennes et partagent une même matrice de covariance, propriété appelée homoscédasticité.

📐 Formule — La fonction sigmoïde est définie par σ(x)=11+exp⁡(−x)\sigma(x)=\frac{1}{1+\exp(-x)} et transforme le score linéaire en probabilité.

📐 Formule — Sous les hypothèses de l’analyse discriminante linéaire, la probabilité postérieure s’écrit P(Y=1∣x)=σ(wTx+b)P(Y=1\mid x)=\sigma(w^Tx+b).

📐 Formule — La régression logistique maximise la vraisemblance, ce qui revient à minimiser la perte d’entropie croisée L(w,b)=∑i[−yilog⁡σ(wTxi+b)−(1−yi)log⁡(1−σ(wTxi+b))]L(w,b)=\sum_i[-y_i\log\sigma(w^Tx_i+b)-(1-y_i)\log(1-\sigma(w^Tx_i+b))].

Astuce mémo

Hypothèses gaussiennes → probabilité sigmoïde → régression logistique

4. Dérivées et gradient

Notions clés & Définitions

  • Gradient : Vecteur dont les composantes sont ses dérivées partielles par rapport aux composantes de l’entrée.

★ À maîtriser

📐 Formule — La règle de chaîne donne df(g(x))dx=dfdgdgdx\frac{d f(g(x))}{dx}=\frac{df}{dg}\frac{dg}{dx} et, pour plusieurs fonctions intermédiaires, dfdx=∑i∂f∂gi∂gi∂x\frac{df}{dx}=\sum_i\frac{\partial f}{\partial g_i}\frac{\partial g_i}{\partial x}.

Compléments

📐 Formule — La dérivée d’une fonction est définie par f′(x)=lim⁡Δ→0f(x+Δ)−f(x)Δf'(x)=\lim_{\Delta\to0}\frac{f(x+\Delta)-f(x)}{\Delta}.

  • Pour une fonction scalaire, le gradient indique la direction de plus forte croissance locale.

Astuce mémo

Dérivée → dérivée partielle → règle de chaîne → gradient

5. Descente de gradient stochastique

★ À maîtriser

📐 Formule — La descente de gradient met à jour les paramètres selon θt+1=θt−γ∇θL(θt)\theta_{t+1}=\theta_t-\gamma\nabla_\theta L(\theta_t), où γ\gamma est le taux d’apprentissage.

  • Le taux d’apprentissage et l’initialisation des paramètres sont critiques pour la convergence de la descente de gradient.

📐 Formule — La descente de gradient stochastique utilise la mise à jour θt+1=θt−γ∇ℓ(yi(t+1),f(xi(t+1);θt))\theta_{t+1}=\theta_t-\gamma\nabla\ell(y_{i(t+1)},f(x_{i(t+1)};\theta_t)).

Compléments

📐 Formule — En descente de gradient par lots, le gradient du risque empirique est ∇L(θ)=1N∑i∇ℓ(yi,f(xi;θ))\nabla L(\theta)=\frac{1}{N}\sum_i\nabla\ell(y_i,f(x_i;\theta)).

  • Si l’estimateur de gradient stochastique est non biaisé, sa moyenne coïncide avec le gradient du risque empirique et la convergence peut être établie sous des hypothèses appropriées. — Bottou, 2011

Astuce mémo

Batch parcourt tout le jeu, SGD choisit un exemple

6. Couches et perceptron multicouche

Notions clés & Définitions

  • Perceptron multicouche : Réseau entièrement connecté à propagation avant composé de couches successives d’opérations affines et d’activations.

★ À maîtriser

📐 Formule — Une couche entièrement connectée calcule h=σ(Wx+b)h=\sigma(Wx+b), où x∈Rpx\in\mathbb{R}^p, h∈Rqh\in\mathbb{R}^q, W∈Rp×qW\in\mathbb{R}^{p\times q} et b∈Rqb\in\mathbb{R}^q.

📐 Formule — Pour une classification binaire, la dernière couche produit une sortie sigmoïde représentant P(Y=1∣x)P(Y=1\mid x).

📐 Formule — Pour une classification à CC classes, la fonction softmax est définie par Softmax⁡(z)i=exp⁡(zi)∑j=1Cexp⁡(zj)\operatorname{Softmax}(z)_i=\frac{\exp(z_i)}{\sum_{j=1}^{C}\exp(z_j)}.

Compléments

📌 En régression, l’activation finale peut être supprimée afin de produire des valeurs de sortie non bornées.

Astuce mémo

Entrée → couches cachées → sortie

7. Différentiation automatique et rétropropagation

Notions clés & Définitions

  • Rétropropagation : Application récursive de la règle de chaîne vers l’arrière sur le graphe computationnel d’un réseau neuronal.

★ À maîtriser

  • La différentiation automatique calcule les dérivées de la perte par rapport à tous les paramètres en exploitant le graphe computationnel du modèle.

📐 Formule — La règle de chaîne pour une composition scalaire vérifie dydx=∑k=1m∂y∂uk∂uk∂x\frac{dy}{dx}=\sum_{k=1}^{m}\frac{\partial y}{\partial u_k}\frac{\partial u_k}{\partial x}.

Compléments

  • Les dérivées de la rétropropagation réutilisent les valeurs intermédiaires calculées pendant la propagation avant.

Astuce mémo

Propagation avant → calcul de la perte → rétropropagation

Tableaux de synthèse

Unités et sorties

UnitéEntréesSortie
TLUEntrées booléennesSortie booléenne seuillée
PerceptronEntrées réellesSortie binaire
Unité logistiqueEntrées réellesProbabilité sigmoïde
SoftmaxScores de C classesVecteur de probabilités

Teste tes connaissances

Teste tes connaissances sur Bases des réseaux de neurones avec 22 questions à choix multiples et corrections détaillées.

1. Quel calcul une unité logique à seuil applique-t-elle à ses entrées ?

2. Quelle expression réalise une porte AND avec une unité logique à seuil pour des entrées binaires ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Bases des réseaux de neurones avec 40 flashcards interactives.

Quelle formule calcule une unité logique à seuil ?

f(x)=1{∑iwixi+b≥0}f(x)=\mathbf{1}\left\{\sum_i w_i x_i+b\geq 0\right\}.

Qui a introduit l'unité logique à seuil en 1943 ?

McCulloch et Pitts en 1943.

Comment s'exprime la porte logique OR par vote pondéré ?

or⁡(x1,x2)=1{x1+x2−0.5≥0}\operatorname{or}(x_1,x_2)=\mathbf{1}\{x_1+x_2-0.5\geq0\}.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches