Fiche de révision : Représentation du texte en NLP

Plan du Cours

  1. Représentation du texte
  2. Sac de mots
  3. Tokenisation et vocabulaire
  4. TF-IDF
  5. Word embeddings
  6. GloVe
  7. FastText

1. Représentation du texte

Notions clés & Définitions

  • Représentation du texte : La représentation du texte est la transformation d’un contenu linguistique en une forme exploitable par des modèles d’apprentissage automatique.
  • Données textuelles : Les données textuelles sont des contenus écrits dont l’information doit être convertie en données numériques pour être traitée par un ordinateur.
  • Traitement du langage naturel : Le traitement du langage naturel regroupe les méthodes qui permettent aux systèmes de manipuler des textes pour réaliser des tâches automatiques.

Points essentiels

  • Les ordinateurs ne traitent pas directement le texte brut et doivent donc le convertir en représentation numérique utilisable par des algorithmes d’apprentissage automatique.
  • La classification de texte, l’analyse de sentiments et la traduction automatique exigent une représentation numérique du texte pour fonctionner.
  • Sans représentation numérique, il est impossible de comparer, analyser ou extraire des informations significatives depuis des documents textuels.
  • La représentation du texte sert à capturer des caractéristiques pertinentes du contenu tout en facilitant l’interprétation par les modèles de machine learning.

2. Sac de mots

Notions clés & Définitions

  • Bag of Words : Un modèle de représentation qui convertit un document en vecteur en utilisant uniquement la fréquence des mots issus d’un vocabulaire défini sur le corpus.
  • Tokenisation : Une étape de préparation qui découpe le texte en unités de base appelées tokens, qui peuvent être des mots ou des n-grams.
  • N-gram : Une sous-séquence de n mots consécutifs extraite du texte pour enrichir le vocabulaire utilisé par le modèle.
  • Matrice des caractéristiques : Une matrice issue de la vectorisation où chaque ligne correspond à un document et chaque colonne à un terme du vocabulaire, avec des valeurs issues des fréquences.

Points essentiels

  • Le sac de mots ignore l’ordre des mots et les relations syntaxiques, mais conserve l’information via la fréquence des tokens dans chaque document.
  • Le vocabulaire est l’ensemble des mots distincts extraits de tous les documents du corpus, et sa taille fixe la dimension des vecteurs.
  • La vectorisation construit, pour chaque document, un vecteur dont chaque dimension correspond à un mot du vocabulaire et contient sa fréquence (ou sa présence) dans le document.
  • Après vectorisation, on obtient une matrice où les éléments sont souvent 0 ou 1, ce qui rend la matrice fréquemment creuse car chaque document n’emploie qu’une partie du vocabulaire.
  • CountVectorizer (sklearn) transforme un texte en matrice de fréquence des mots selon l’approche Bag of Words.

Astuce mémo

BoW = fréquences seulement : même mots, même vecteur, peu importe l’ordre.

3. Tokenisation et vocabulaire

Notions clés & Définitions

  • Vocabulaire : Le vocabulaire est l’ensemble des mots distincts présents dans le corpus, utilisé comme base des dimensions des vecteurs.
  • Dimension de vocabulaire : Une dimension de vocabulaire correspond à un mot précis du vocabulaire et sert à stocker sa présence ou sa fréquence dans un document.

Points essentiels

  • La taille du vocabulaire dépend du corpus et de sa diversité, et elle fixe directement la dimensionnalité des vecteurs ainsi que les coûts mémoire et calcul.
  • La tokenisation transforme un texte en liste de tokens, par exemple Texte 1 en ["Les","pommes","sont","rouges","et","sucrées"].
  • Le vocabulaire se construit en extrayant tous les mots distincts du corpus, puis chaque mot devient une dimension du vecteur.
  • Une fois le vocabulaire établi, chaque document est converti en vecteur dont chaque dimension encode la fréquence du mot dans le document, ou sa présence/absence selon le codage utilisé (0 ou 1).

Astuce mémo

Vocabulaire = ensemble des mots distincts, donc des colonnes dans ton vecteur.

4. TF-IDF

Notions clés & Définitions

  • Term Frequency TF : La fréquence des termes mesure combien un mot tt apparaît dans un document dd, en rendant ce score plus élevé quand le mot revient souvent dans ce document.
  • Inverse Document Frequency IDF : L’IDF mesure à quel point un mot tt est rare dans l’ensemble du corpus, en abaissant la valeur quand le mot apparaît dans beaucoup de documents.
  • TF-IDF : Le TF-IDF combine la fréquence dans un document et la rareté dans le corpus pour produire un score d’importance du terme, plus élevé quand le mot est fréquent localement et rare globalement.

Points essentiels

  • Le TF correspond à la proportion de la fréquence du mot par rapport à la taille du document, ce qui normalise la répétition.
  • Si un terme apparaît dans tous les documents, son IDF devient faible, car il apporte peu d’information discriminante.
  • TF-IDF augmente quand TF est élevé et IDF est élevé, donc quand le terme est fréquent dans un document et rare ailleurs.
  • Un mot avec une TF-IDF élevée est à la fois fréquent dans le document analysé et rare dans les autres documents.
  • Chaque document peut être représenté comme un vecteur où chaque dimension correspond à un terme et la valeur est son score TF-IDF pour ce document.
  • Dans la recherche d’information, TF-IDF sert à évaluer la pertinence des documents par rapport à une requête.

Astuce mémo

TF-IDF = TF (souvent ici) × IDF (rare ailleurs) : “forte présence locale, faible bruit global”.

5. Word embeddings

Notions clés & Définitions

  • Word embeddings : Des représentations vectorielles apprises sur de grands corpus qui codent la sémantique à partir du contexte d’apparition des mots.
  • Espace vectoriel : Un espace où chaque mot est associé à un vecteur, ce qui permet de mesurer sa proximité sémantique avec les vecteurs des autres mots.
  • CBOW : Une architecture de Word2Vec qui prédit un mot central à partir des mots de son contexte.
  • Skip-gram : Une architecture de Word2Vec qui prédit les mots de contexte à partir d’un mot central.

Points essentiels

  • Les mots ayant des significations similaires apparaissent souvent dans des contextes similaires, ce qui permet d’obtenir des relations sémantiques via des calculs vectoriels.
  • Dans CBOW, le modèle prend les mots environnants, les agrège en une représentation (souvent une moyenne), puis prédit la probabilité du mot cible central.
  • Dans Skip-gram, le but est inverse de CBOW : à partir d’un mot central, le modèle prédit les mots qui l’entourent.
  • Skip-gram a tendance à mieux capturer les représentations des mots rares mais peut être plus lent à entraîner que CBOW.
  • Word2Vec utilise une fonction d’activation de type sigmoïde et optimise avec SGD pour réduire une erreur de prédiction de contexte via une fonction de coût.
  • Les embeddings Word2Vec sont souvent de faible dimension (100 à 300) et ignorent l’ordre des mots dans le contexte.

Astuce mémo

CBOW = Centre Avec le contexte ; Skip-gram = Contexte Depuis le centre.

6. GloVe

Notions clés & Définitions

  • GloVe : GloVe est un modèle d’embeddings qui apprend des vecteurs de mots à partir des cooccurrences globales observées dans un corpus.
  • Matrice de cooccurrence : Une matrice de cooccurrence XX compte, pour chaque paire de mots, combien de fois ils apparaissent ensemble dans une fenêtre de contexte.
  • Factorisation de matrice : La factorisation de matrice vise à décomposer XX en représentations vectorielles des mots en minimisant une fonction de coût sur les paires (i,j)(i,j).

Points essentiels

  • GloVe a été développé à Stanford en 2014 pour exploiter des statistiques globales du corpus afin d’améliorer des approches comme Word2Vec.
  • GloVe construit XX, où X[i,j]X[i,j] est le nombre d’occurrences où le mot ii apparaît avec le mot jj dans une fenêtre de taille fixée.
  • Le modèle apprend des vecteurs viv_i et vjv_j en cherchant une factorisation de XX qui minimise une fonction de coût liée aux paires de mots (i,j)(i,j).
  • GloVe peut être utilisé pour des moteurs de recherche avec suggestions, pour l’analyse de sentiment avec termes positifs/négatifs, et pour des recommandations fondées sur des mots sémantiquement proches.

Astuce mémo

Cooccurrences globales → matrice → factorisation : GloVe lit les cooccurrences avant de “construire” les vecteurs.

7. FastText

Notions clés & Définitions

  • FastText : FastText est une extension de Word2Vec développée par Facebook AI qui apprend des représentations à partir de sous-mots (n-grammes).
  • Sous-mots n-grammes : Les sous-mots sont des morceaux de mots utilisés pour former la représentation d’un mot plutôt que de traiter le mot comme une unité unique.
  • Somme des vecteurs de sous-mots : La représentation d’un mot est obtenue en combinant les vecteurs de ses n-grammes, ce qui permet de mieux généraliser.

Points essentiels

  • FastText décompose un mot en n-grammes et représente le mot comme une somme de vecteurs de sous-mots, contrairement à Word2Vec et GloVe qui traitent le mot directement.
  • FastText peut produire un vecteur même pour un mot jamais vu à l’entraînement grâce à ses sous-mots.
  • Dans l’exemple, smartphone peut être décomposé en morceaux comme smar, mart, phon et hone pour gérer un mot rare ou inconnu.
  • Exemple de réglages : FastText(sentences=corpus, vector_size=50, window=5, min_count=1, workers=4) fixe respectivement la taille des vecteurs, la fenêtre de contexte, le seuil minimal de fréquence et le nombre de threads.

Astuce mémo

Sous-mots = “filet de sécurité” : même si un mot est inédit, ses n-grammes permettent de calculer un vecteur.

Repères chronologiques

DateÉvénement
2025 / 2026Année universitaire du cours
2013Développement de Word2Vec par Mikolov et al. (2013)
2014Développement de GloVe par Stanford (2014)
2014GloVe exploite des statistiques globales du corpus (mentionée pour 2014)

Tableaux de synthèse

Comparaison des représentations de texte

MéthodePrincipeInformation capturée
BoWVise un vecteur à partir de la fréquence des motsPrésence/fréquence des tokens, sans ordre ni relations syntaxiques
TF-IDFCombine fréquence dans le document et rareté dans le corpusImportance discriminante des termes (fréquent localement, rare globalement)
Word embeddingsApprend des vecteurs via le contexte sur de grands corpusSémantique via proximité vectorielle (relations sémantiques/syntaxiques)

CBOW vs Skip-gram (Word2Vec)

ArchitectureRôleTendance mentionnée
CBOWPrédit un mot cible à partir des mots du contexte (moyenne)Plus rapide et adaptée aux corpus de taille plus petite ; généralise mieux les mots fréquents
Skip-gramPrédit les mots de contexte à partir d’un mot centralMieux pour les mots rares ; peut être plus lent à entraîner

Pièges & confusions fréquents

  1. Confondre la représentation du texte (conversion en forme numérique pour ML) avec le traitement du texte brut directement, alors que les ordinateurs ne traitent pas le texte brut.
  2. Croire que le sac de mots conserve l’ordre ou la syntaxe : le BoW ignore l’ordre des mots et les relations syntaxiques.
  3. Mélanger vocabulaire et tokenisation : la tokenisation produit des tokens, puis le vocabulaire extrait les mots distincts (tokens) pour définir les dimensions du vecteur.
  4. Se tromper sur TF-IDF : TF mesure la fréquence (proportion) dans un document, et IDF mesure la rareté du terme dans l’ensemble du corpus.
  5. Penser que TF-IDF favorise uniquement les mots rares : en réalité, une TF-IDF élevée requiert TF élevé et IDF élevé (donc rare ailleurs).
  6. Croire que Word2Vec/GloVe donnent des vecteurs “par mot” sans lien au contexte : ils apprennent des représentations à partir des contextes (Word2Vec) ou des cooccurrences globales (GloVe).
  7. Imaginer que FastText ne gère pas les mots inconnus : grâce aux sous-mots (n-grammes), il peut générer un vecteur même si le mot n’a jamais été vu.

Checklist Examen

  1. Expliquer pourquoi la représentation du texte est nécessaire en TLN pour rendre le texte exploitable par des modèles d’apprentissage automatique.
  2. Citer les principales techniques de représentation : sac de mots (BoW), TF-IDF, word embeddings.
  3. Pour BoW, décrire le principe : créer un vecteur par document où chaque dimension correspond à un mot du vocabulaire et la valeur à sa fréquence.
  4. Pour BoW, ordonner les étapes : tokenisation (mots ou n-grams), construction du vocabulaire (mots distincts), vectorisation, puis matrice des caractéristiques.
  5. Décrire ce que sont les tokens et donner le rôle des n-grams dans la tokenisation.
  6. Relier BoW à ses limites : absence d’ordre des mots et absence des relations syntaxiques.
  7. Pour TF-IDF, définir TF (importance via fréquence dans le document) et IDF (importance via rareté dans le corpus) et expliquer l’effet combiné sur la valeur TF-IDF.
  8. Expliquer comment TF-IDF représente un document : chaque dimension est un terme et la valeur est le score TF-IDF du terme.
  9. Décrire le rôle de word embeddings : apprendre des vecteurs sémantiques à partir du contexte et mesurer des relations via des calculs vectoriels (ex. distance cosinus).
  10. Pour Word2Vec, distinguer CBOW et Skip-gram par le sens de la prédiction (contexte→cible vs cible→contexte) et rappeler les tendances (mots fréquents/rares, vitesse).
  11. Pour GloVe, expliquer la séquence : construire la matrice de cooccurrence X sur une fenêtre, puis factoriser la matrice pour apprendre les vecteurs (minimisation d’une fonction de coût).
  12. Pour FastText, expliquer la logique des sous-mots : représenter un mot comme somme de vecteurs de n-grammes et préciser l’objectif (gestion des mots rares/inconnus).

Teste tes connaissances

Teste tes connaissances sur Représentation du texte en NLP avec 11 questions à choix multiples et corrections détaillées.

1. Quel est le rôle principal de la représentation du texte en traitement automatique du langage naturel ?

2. Qu'est-ce que la représentation du texte en traitement du langage naturel ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Représentation du texte en NLP avec 9 flashcards interactives.

Représentation du texte — rôle ?

Convertir le texte en données numériques exploitables

Représentation du texte

Transformation en forme exploitable par AI.

Sac de mots — principe ?

Vecteur basé sur la fréquence des mots, sans ordre

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches