Fiche de révision : Traitement d’image et deep learning

Plan du Cours

  1. Représentation numérique des images
  2. Pixels, couleurs et NumPy
  3. Manipulations et transformations de pixels
  4. Filtrage spatial et convolution
  5. Bits et stéganographie
  6. IA, machine learning et deep learning
  7. Lexique de l’apprentissage automatique
  8. Neurone et fonctions d’activation
  9. MNIST et architecture MLP
  10. Entraînement et évaluation du modèle

1. Représentation numérique des images

Notions clés & Définitions

  • Image matricielle : Grille finie de points discrets appelés pixels, représentée en traitement d’image par des matrices 2D ou des tenseurs 3D.

★ À maîtriser

📌 Une image vectorielle est définie par des équations géométriques et conserve une netteté absolue à tout facteur de zoom, tandis qu’une image matricielle est une grille finie de pixels qui peut devenir pixellisée lors d’un agrandissement.

Compléments

  • Les images vectorielles utilisent notamment les formats SVG, PDF et EPS, tandis que les images matricielles utilisent notamment JPEG, PNG, BMP et TIFF.

Astuce mémo

Vectorielle = équations et zoom net ; matricielle = pixels et pixellisation

2. Pixels, couleurs et NumPy

Notions clés & Définitions

  • Pixel : Repéré par une ligne y comprise entre 0 et H−1, une colonne x comprise entre 0 et W−1, et un ou plusieurs canaux de couleur.

Points essentiels

  • Les représentations de couleur sont:
    • niveaux de gris avec un canal d’intensité
    • RGB avec les canaux rouge, vert et bleu
    • RGBA avec rouge, vert, bleu et alpha

📌 La conversion d’une image en flottants dans l’intervalle [0.0,1.0] évite les dépassements de capacité lors des calculs algébriques matriciels.

3. Manipulations et transformations de pixels

★ À maîtriser

📐 Formule — L’inversion négative d’un pixel ou d’une image normalisée s’effectue avec pinv=1.0−pp_{inv}=1.0-p.

📐 Formule — La luminance selon la norme ITU-R BT.709 est l=0.2126r+0.7152g+0.0722bl=0.2126r+0.7152g+0.0722b.

📐 Formule — Le mélange alpha de deux images est calculé par I=αI1+(1−α)I2I=\alpha I_1+(1-\alpha)I_2, tandis que le masquage pixel à pixel est calculé par I′=I×ImI'=I\times I_m.

Compléments

  • L’isolation du canal rouge consiste à créer une matrice nulle de même taille, puis à recopier dans son canal d’indice 0 les valeurs rouges de l’image source.

Astuce mémo

Accéder, isoler, découper, bruiter, convertir, mélanger

4. Filtrage spatial et convolution

Notions clés & Définitions

  • Convolution 2D : Fait glisser un noyau compact K sur l’image et additionne les produits entre les pixels voisins et les coefficients correspondants du noyau.

Points essentiels

📐 Formule — Dans un flou moyenneur, chaque pixel est remplacé par la moyenne de ses voisins dans une fenêtre de taille (2s+1)×(2s+1), selon Iflou(y,x)=1(2s+1)2∑u=−ss∑v=−ssI(y+u,x+v)I_{flou}(y,x)=\frac{1}{(2s+1)^2}\sum_{u=-s}^{s}\sum_{v=-s}^{s}I(y+u,x+v).

  • Le noyau Laplacien 3×3 utilisé pour détecter les contours est [[−1,−1,−1],[−1,8,−1],[−1,−1,−1]], un filtre passe-haut qui extrait les variations brutales.

Astuce mémo

Noyau glissant → voisinage combiné → flou, netteté ou contours

5. Bits et stéganographie

Points essentiels

  • Pour des entiers uint8 codés sur 8 bits, l’opérateur & réalise un ET, | un OU, ^ un OU exclusif, ~ un complément, << n un décalage gauche et >> n un décalage droit.

  • Dans un octet, les bits de poids fort b7 à b4 portent 94 % de l’information visuelle, tandis que les bits de poids faible b3 à b0 correspondent à des nuances généralement imperceptibles.

  • La dissimulation d’une image remplace les quatre bits de poids faible de l’image hôte par les quatre bits de poids fort de l’image secrète, puis l’extraction récupère ces quatre bits et les décale vers les poids forts.

  • La stéganographie textuelle convertit chaque caractère ASCII en 8 bits, remplace le bit de poids faible de chaque canal par un bit du message, puis ajoute un octet sentinelle nul.

Astuce mémo

MSB visibles ; LSB discrets

6. IA, machine learning et deep learning

Points essentiels

📌 L’intelligence artificielle regroupe les techniques permettant à une machine d’imiter un comportement humain intelligent, le machine learning apprend des règles à partir de données statistiques, et le deep learning utilise des réseaux de neurones artificiels profonds.

📌 L’approche classique applique des règles écrites aux données, tandis que le deep learning déduit un modèle à partir de données et de réponses en ajustant des paramètres numériques.

Astuce mémo

IA → ML → DL : des règles générales aux réseaux profonds

7. Lexique de l’apprentissage automatique

Notions clés & Définitions

  • Fonction de perte : Mesure numérique de l’erreur commise par le réseau et doit tendre vers 0.
  • Learning rate : Pas d’apprentissage qui contrôle la vitesse d’ajustement des poids à chaque étape.
  • Époque : Cycle complet durant lequel le modèle a vu tout le dataset d’entraînement.

8. Neurone et fonctions d’activation

★ À maîtriser

📐 Formule — Un neurone formel calcule d’abord z=∑i=1Nwixi+bz=\sum_{i=1}^{N}w_i x_i+b, puis produit y=f(z)y=f(z) après application d’une fonction d’activation.

📌 Sans fonction d’activation, empiler plusieurs couches reste une transformation linéaire équivalente à une seule opération, tandis qu’une activation non linéaire permet d’apprendre des frontières de décision complexes.

Compléments

📐 Formule — Les fonctions d’activation présentées sont ReLU, définie par max⁡(0,x)\max(0,x), et SiLU, définie par x⋅σ(x)x\cdot\sigma(x).

Astuce mémo

Somme pondérée → activation non linéaire → décision complexe

9. MNIST et architecture MLP

★ À maîtriser

  • Le dataset MNIST contient 60 000 images d’entraînement et 10 000 images de test de chiffres manuscrits répartis en 10 classes, de 0 à 9.

  • Chaque image MNIST possède 28×28 pixels en niveaux de gris, soit 784 pixels, avec des valeurs normalisées entre 0.0 et 1.0.

  • Dans le MLP, un mini-batch de forme [256,1,28,28] est aplati en [256,784], transformé successivement en [256,256], [256,128], [256,64], puis en [256,10] logits.

📐 Formule — La fonction Softmax transforme les logits en probabilités selon P(y=i)=ezi∑j=110ezjP(y=i)=\frac{e^{z_i}}{\sum_{j=1}^{10}e^{z_j}}, puis torch.argmax retient la classe de probabilité maximale.

Compléments

  • L’architecture MLP présentée comporte 242 762 poids et biais ajustables.

Astuce mémo

28×28 → 784 → 256 → 128 → 64 → 10

10. Entraînement et évaluation du modèle

★ À maîtriser

📐 Formule — La descente de gradient met à jour les poids selon W←W−η⋅∇WLW\leftarrow W-\eta\cdot\nabla_W\mathcal{L} afin de diminuer l’erreur.

  • Un learning rate de 10⁻⁶ ralentit fortement l’apprentissage, 10⁻³ offre une convergence rapide et stable, tandis que 1.0 peut provoquer une divergence.

  • 🔄 La boucle d’apprentissage suit cinq étapes:

    1. forward pass et prédiction
    2. calcul de la perte
    3. remise à zéro des gradients
    4. rétropropagation
    5. mise à jour des paramètres

📌 L’overfitting survient lorsque le modèle mémorise le bruit des 60 000 exemples d’entraînement et perd sa capacité à généraliser aux 10 000 exemples de test, faisant remonter la perte de test.

📌 Un MLP perd la notion de voisinage et de translation en aplatisant l’image avec Flatten, tandis qu’un réseau convolutif conserve la géométrie grâce à des noyaux glissants.

Compléments

  • La matrice de confusion présente une précision globale supérieure à 97,8 % et met notamment en évidence les confusions entre 4 et 9, entre 7 et 2, ainsi qu’entre 3 et 5 ou 8.

Astuce mémo

Prédire → mesurer → réinitialiser → rétropropager → mettre à jour

Tableaux de synthèse

Formats et représentations des images

TypeReprésentationConséquence
VectorielleÉquations géométriquesNetteté à tout zoom
MatricielleGrille finie de pixelsPixellisation à l’agrandissement
Niveaux de gris1 canal d’intensitéValeur scalaire
RGB/RGBA3 ou 4 canauxCouleur avec alpha éventuel

Évaluation et apprentissage

NotionRôleValeur ou risque
Learning rateTaille du pas de mise à jour10⁻³ stable ; 1.0 divergent
EntraînementApprentissage sur les données vues60 000 images
TestMesure de généralisation10 000 images inédites
OverfittingMémorisation du bruitPerte de test en hausse

Teste tes connaissances

Teste tes connaissances sur Traitement d’image et deep learning avec 28 questions à choix multiples et corrections détaillées.

1. Concernant la distinction entre images vectorielles et matricielles :

2. Parmi les propositions suivantes concernant la représentation matricielle des images, la(les)quelle(s) est(sont) exacte(s) ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Traitement d’image et deep learning avec 58 flashcards interactives.

Qu'est-ce qui définit une image vectorielle ?

Des équations géométriques définissent une image vectorielle.

Qu'est-ce qui cause la pixellisation d'une image matricielle ?

L'agrandissement d'une grille finie de pixels cause la pixellisation.

Quels formats sont utilisés pour les images vectorielles ?

Les formats SVG, PDF et EPS sont utilisés pour les images vectorielles.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches