Prétraitement = rendre le texte « exploitable » avant l’apprentissage automatique.
Nettoyage = enlever ; Normalisation = mettre tous les textes à la même « échelle ».
Tokens pour découper, NER pour nommer, POS pour classer.
BoW compte ; TF-IDF nuance ; Embeddings remplacent les mots par des vecteurs.
Multilingue = mélange + morphologie + alphabets, donc on commence par détecter la langue.
3 chemins : adapter, traduire, ou utiliser un modèle multilingue.
| Aspect | Nettoyage | Normalisation |
|---|---|---|
| But | Supprimer l’indésirable | Uniformiser l’écriture |
| Cible | Réduction du bruit | Réduction de la variabilité |
| Exemples | Stopwords, balises HTML | Minuscules, suppression accents, stemming/lemmatisation |
| Stratégie | Idée centrale | Point faible |
|---|---|---|
| Prétraitement spécifique | Pipeline adapté après détection | Nécessite plusieurs outils et ressources |
| Langue pivot | Traduire puis prétraiter | Traduction imparfaite et perte d’information |
| Modèles multilingues | Modèles pré-entraînés multi-langues | Plus lourd et nécessite GPU |
Teste tes connaissances sur Introduction aux Techniques de Prétraitement NLP avec 12 questions à choix multiples et corrections détaillées.
1. Quel est l’objectif principal du prétraitement du texte avant l’apprentissage automatique ?
2. Quelle situation illustre le mieux la variabilité linguistique ?
Mémorisez les concepts clés de Introduction aux Techniques de Prétraitement NLP avec 12 flashcards interactives.
Prétraitement linguistique — définition ?
Opérations pour rendre le texte exploitable par NLP.
Bruit linguistique — exemple ?
Caractères, ponctuations inutiles, balises HTML.
Variabilité linguistique — cause ?
Différences d’écriture pour un même terme.
Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.
Générateur de fiches