QCM : Représentation du texte en NLP — 11 questions

Questions et réponses du QCM

1. Quel est le rôle principal de la représentation du texte en traitement automatique du langage naturel ?

Transformer un contenu linguistique en une forme numérique exploitable par des modèles
Compter uniquement les mots les plus fréquents d’un corpus
Supprimer toute information sémantique pour simplifier l’analyse
Conserver l’ordre exact des mots dans une phrase

Transformer un contenu linguistique en une forme numérique exploitable par des modèles

Explication

La représentation du texte consiste à convertir le langage en une forme numérique utilisable par des algorithmes d’apprentissage automatique. Elle ne se limite pas au comptage des mots et ne cherche pas à conserver l’ordre exact des mots.

2. Qu'est-ce que la représentation du texte en traitement du langage naturel ?

Une méthode pour convertir un contenu linguistique en une forme exploitable par des modèles d'apprentissage automatique.
Une approche pour traduire des textes d'une langue à une autre.
Une procédure pour générer automatiquement des résumés de documents.
Une technique pour analyser la syntaxe et la grammaire des textes.

Une méthode pour convertir un contenu linguistique en une forme exploitable par des modèles d'apprentissage automatique.

Explication

La représentation du texte consiste à transformer un contenu linguistique en une forme numérique compréhensible par les algorithmes d'apprentissage automatique, ce qui est essentiel pour leur traitement.

3. Pourquoi une représentation numérique du texte est-elle nécessaire avant d’appliquer des modèles de machine learning ?

Parce que les ordinateurs ne traitent pas directement le texte brut
Parce que le texte brut est déjà une matrice de caractéristiques
Parce que toute analyse de texte exige une traduction automatique préalable
Parce que les modèles ne peuvent utiliser que des données audio

Parce que les ordinateurs ne traitent pas directement le texte brut

Explication

Les ordinateurs ne manipulent pas directement le texte brut ; il faut donc le convertir en données numériques. Cette conversion permet ensuite de comparer, analyser et extraire des informations de manière automatique.

4. Pourquoi la représentation du texte est-elle essentielle en traitement du langage naturel ?

Elle permet de convertir le contenu linguistique en une forme exploitable par des modèles d’apprentissage automatique.
Elle facilite la traduction automatique en conservant la syntaxe originale.
Elle supprime les ambiguïtés du texte en utilisant des règles grammaticales.
Elle augmente la longueur du texte pour améliorer la compréhension humaine.

Elle permet de convertir le contenu linguistique en une forme exploitable par des modèles d’apprentissage automatique.

Explication

La représentation du texte est nécessaire pour transformer le contenu linguistique en données numériques exploitables par des algorithmes d'apprentissage automatique, ce qui est indispensable pour toute tâche automatique.

5. Dans le modèle du sac de mots, qu’est-ce qui caractérise principalement la représentation d’un document ?

La fréquence des mots issus d’un vocabulaire défini
La longueur moyenne des phrases du document
La position grammaticale de chaque mot dans la phrase
La similarité sémantique entre les mots du document

La fréquence des mots issus d’un vocabulaire défini

Explication

Le sac de mots transforme un document en vecteur à partir des fréquences des mots du vocabulaire. Il ignore l’ordre des mots et les relations syntaxiques.

6. Quel est le rôle principal du modèle de sac de mots dans la représentation du texte en traitement automatique du langage naturel ?

Convertir un document en vecteur basé uniquement sur la fréquence des mots sans tenir compte de l'ordre.
Capturer la syntaxe et la structure grammaticale des phrases.
Analyser la relation entre les mots et leur position dans le texte.
Représenter la signification sémantique profonde des mots dans leur contexte.

Convertir un document en vecteur basé uniquement sur la fréquence des mots sans tenir compte de l'ordre.

Explication

Le modèle de sac de mots transforme un document en vecteur basé uniquement sur la fréquence des mots, ignorant l'ordre et la syntaxe, mais conservant l'information sur la présence ou la fréquence des tokens.

7. Quelle propriété du sac de mots explique qu’une matrice de caractéristiques soit souvent creuse ?

Chaque document n’utilise qu’une partie du vocabulaire
Le vocabulaire change à chaque ligne de la matrice
Chaque mot apparaît dans tous les documents du corpus
Les valeurs de la matrice sont uniquement des nombres négatifs

Chaque document n’utilise qu’une partie du vocabulaire

Explication

Comme un document n’emploie qu’une fraction des mots du vocabulaire, beaucoup de cases restent à zéro. Cela rend la matrice fréquemment creuse.

8. En quelle année le modèle GloVe a-t-il été développé pour exploiter les statistiques globales du corpus dans l'apprentissage des vecteurs de mots ?

2013
2016
2014
2015

2014

Explication

GloVe a été développé en 2014 par Stanford pour utiliser des statistiques globales du corpus afin d'améliorer la qualité des embeddings.

9. En quoi la méthode TF-IDF diffère-t-elle du modèle de sac de mots dans la représentation du texte en traitement du langage naturel ?

TF-IDF utilise uniquement la fréquence dans le document, alors que le sac de mots considère la fréquence dans l’ensemble du corpus.
TF-IDF combine la fréquence locale et la rareté globale d’un terme, tandis que le sac de mots se limite à compter la fréquence des mots dans un document.
TF-IDF ignore la fréquence dans le document et se concentre uniquement sur la rareté globale, contrairement au sac de mots qui utilise la fréquence locale.
TF-IDF et le sac de mots sont identiques, mais TF-IDF est une version améliorée qui inclut la position des mots dans le texte.

TF-IDF combine la fréquence locale et la rareté globale d’un terme, tandis que le sac de mots se limite à compter la fréquence des mots dans un document.

Explication

Le TF-IDF combine la fréquence d’un terme dans un document avec sa rareté dans le corpus, ce qui le différencie du sac de mots qui ne considère que la fréquence locale. La première option explique cette différence.

10. Qui est crédité de la formulation du modèle GloVe, qui apprend des vecteurs de mots à partir des cooccurrences globales dans un corpus ?

Mikolaï et ses collègues
Les chercheurs de Stanford en 2014
Tomas Mikolov et son équipe
Les développeurs de Facebook en 2013

Les chercheurs de Stanford en 2014

Explication

Le modèle GloVe a été développé par des chercheurs de Stanford en 2014 pour exploiter les statistiques globales du corpus dans l'apprentissage des vecteurs de mots.

11. Quelles sont les causes principales pour lesquelles le modèle FastText utilise-t-il des sous-mots (n-grammes) dans ses représentations vectorielles ?

Pour améliorer la précision de la classification en utilisant uniquement des mots fréquents.
Pour réduire la dimensionnalité des vecteurs de mots.
Pour augmenter la vitesse d'apprentissage en utilisant des sous-ensembles de mots.
Pour permettre la génération de vecteurs pour des mots jamais rencontrés lors de l'entraînement.

Pour permettre la génération de vecteurs pour des mots jamais rencontrés lors de l'entraînement.

Explication

FastText utilise des sous-mots pour pouvoir générer des vecteurs pour des mots inconnus ou rares en combinant les vecteurs de leurs n-grammes, ce qui augmente la capacité de généralisation du modèle.

Révisez avec les flashcards

Mémorisez les réponses avec 9 flashcards sur Représentation du texte en NLP.

Représentation du texte — rôle ?

Convertir le texte en données numériques exploitables

Représentation du texte

Transformation en forme exploitable par AI.

Sac de mots — principe ?

Vecteur basé sur la fréquence des mots, sans ordre

Voir les flashcards →

Approfondir avec la fiche

Consultez la fiche de révision complète sur Représentation du texte en NLP.

Voir la fiche →

Cours similaires

Crée tes propres QCM

Importe ton cours et l'IA génère des QCM avec corrections en 30 secondes.

Générateur de QCM