Fiche de révision : Introduction au Reconnaissance d'Entités Nommées

Plan du Cours

  1. Définition du NER
  2. Extraction d’informations
  3. Méthodes à base de lexique
  4. Apprentissage automatique et profond
  5. Approche hybride
  6. Jeux de données NER
  7. Schéma IOB et annotation
  8. Types d’entités et rôle du POS

1. Définition du NER

Notions clés & Définitions

  • NER : NER est une tâche de traitement du langage naturel qui identifie et classe des entités importantes dans du texte non structuré.
  • Entités nommées : Les entités nommées sont des éléments d’intérêt comme des personnes, organisations, lieux, dates, valeurs monétaires ou produits.
  • Texte non structuré : Le texte non structuré est un contenu écrit sans organisation exploitable directement en base de données.
  • Données structurées : Les données structurées sont des sorties issues de l’étiquetage d’entités, prêtes à être analysées ou indexées.

Points essentiels

  • Le NER sert à transformer du texte brut en informations exploitées sous forme d’éléments étiquetés par type d’entité.
  • Les catégories d’entités couvertes incluent des noms propres et aussi des types comme dates et montants d’argent.
  • Le résultat du NER correspond à des informations « importantes » repérées dans le texte plutôt qu’à une simple classification globale.

Astuce mémo

NER = Noms + Règles de Types : repérer qui/quoi/où/quand dans le texte.

2. Extraction d’informations

Notions clés & Définitions

  • Extraction d’informations : L’extraction d’informations est une tâche qui extrait des faits depuis du texte selon des schémas ou modèles prédéfinis.
  • Schémas de base de données : Les schémas de base de données sont des formats de sortie attendus qui déterminent ce que l’on extrait.
  • Entité : Une entité est un objet d’intérêt comme une personne ou une organisation.

Points essentiels

  • L’extraction d’informations suit des modèles fournis à l’avance pour produire une sortie structurée conforme au format attendu.
  • Le but est d’extraire des informations correspondant à un schéma, pas de réécrire le texte sans contrainte.

Astuce mémo

Extraction d’informations = Faits du texte → champs d’un schéma.

3. Méthodes à base de lexique

Notions clés & Définitions

  • Dictionnaire d’entités : Un dictionnaire d’entités est une liste de noms connus utilisée pour détecter des entités dans un texte.
  • Vérification des mots : La vérification des mots consiste à tester si des mots du dictionnaire apparaissent dans la phrase traitée.

Points essentiels

  • La méthode lexicale identifie une entité en recherchant la présence de mots présents dans un dictionnaire d’entités connus.
  • Cette approche est peu utilisée car elle exige une mise à jour fréquente et une maintenance soignée du dictionnaire pour rester efficace.

Astuce mémo

Lexique = Liste à jour : si le dictionnaire n’est pas maintenu, la détection chute.

4. Apprentissage automatique et profond

Notions clés & Définitions

  • Classification multi-classes : La classification multi-classes entraîne un modèle sur des exemples étiquetés où chaque entité reçoit sa classe.
  • CRF : Un CRF est un modèle probabiliste qui exploite la séquence et le contexte des mots pour mieux prédire l’étiquette d’entité.
  • Word Embeddings : Les word embeddings représentent les mots en capturant leur signification dans le contexte.
  • Réseaux neuronaux : Les approches par réseaux neuronaux apprennent des structures complexes à partir des données sans ingénierie manuelle.

Points essentiels

  • En classification multi-classes, chaque entité est classée à partir d’exemples étiquetés et la prise en compte du contexte rend la tâche plus délicate.
  • Le CRF modélise la dépendance entre mots via la séquence et le contexte pour rendre la prédiction plus précise.
  • Les approches profondes utilisent des word embeddings et visent une meilleure précision sur de grands ensembles de données variés.

Astuce mémo

CRF = Contexte + Séquence ; Deep = Représentations (embeddings) qui apprennent seules.

5. Approche hybride

Notions clés & Définitions

  • Approche hybride : Une approche hybride combine des méthodes par règles et des méthodes d’apprentissage automatique ou profond pour améliorer vitesse et précision.
  • Règles basées sur le lexique : Les règles basées sur le lexique utilisent une liste et des vérifications initiales pour poser une classification rapide.
  • Affinage par apprentissage : L’affinage par apprentissage consiste à corriger et compléter les prédictions initiales à l’aide d’un modèle.

Points essentiels

  • L’approche hybride utilise d’abord des règles lexicale pour une classification initiale rapide avant un raffinage par apprentissage.
  • Elle améliore la précision par rapport aux approches prises isolément et s’adapte à des phrases plus complexes.
  • Elle est plus difficile à mettre en œuvre car elle requiert l’intégration de plusieurs systèmes.

Astuce mémo

Hybride = Règles pour démarrer + Modèle pour affiner.

6. Jeux de données NER

Notions clés & Définitions

  • Jeu de données NER : Un jeu de données NER sert à entraîner des modèles qui détectent des entités dans un texte.
  • Annotations au niveau du mot : Les annotations au niveau du mot attribuent une étiquette d’entité à chaque token.
  • Détection d’entités : La détection d’entités consiste à repérer dans un texte les segments appartenant à des catégories comme personnes ou lieux.

Points essentiels

  • Les jeux de données NER incluent des entités de types comme noms de personnes, organisations, lieux, dates et montants d’argent.
  • Les annotations sont réalisées au niveau des tokens et non au niveau de la phrase entière.

Astuce mémo

NER dataset = Étiquette par mot : une carte d’identité token par token.

7. Schéma IOB et annotation

Notions clés & Définitions

  • Schéma IOB : Le schéma IOB encode la position d’un token par rapport à une entité avec des tags B, I et O.
  • Tag B : Le tag B indique que le token est le début d’une entité.
  • Tag I : Le tag I indique que le token est à l’intérieur d’une entité.
  • Tag O : Le tag O indique que le token ne fait partie d’aucune entité.

Points essentiels

  • Dans l’exemple, Barack reçoit B-PER, Obama reçoit I-PER, visited reçoit O, Paris reçoit B-LOC et 2015 reçoit B-DATE.
  • Les jeux de données NER suivent souvent un format tabulaire au niveau des tokens avec Phrase, Mot, POS et Tag.

Astuce mémo

IOB = Begin / Inside / Outside : B démarre, I prolonge, O ignore.

8. Types d’entités et rôle du POS

Notions clés & Définitions

  • PERSON : PERSON est un type d’entité correspondant aux noms de personnes dans un jeu de données NER.
  • ORGANIZATION : ORGANIZATION est un type d’entité correspondant aux organisations dans un jeu de données NER.
  • LOCATION : LOCATION est un type d’entité correspondant aux lieux dans un jeu de données NER.
  • POS : Le POS est l’étiquette grammaticale d’un mot, utilisée dans certains jeux de données NER comme information linguistique.

Points essentiels

  • Les types courants listés incluent PERSON, ORGANIZATION, LOCATION, DATE, TIME, MONEY, PERCENT et GPE.
  • Les POS aident à identifier les noms propres et améliorent les performances de modèles classiques comme CRF et SVM.

Astuce mémo

POS = indice grammatical : ça aide surtout à repérer les noms propres.

Repères chronologiques

DateÉvénement
2015Année annotée comme entité DATE dans l’exemple
June 2020Date exemple annotée dans les types d’entités
3:30 PMHoraire exemple annoté comme entité TIME

Tableaux de synthèse

Comparaison des approches de NER

ApprocheIdée centraleAtout cléLimite clé
LexiqueRecherche dans un dictionnaireDétection directe par présenceMaintenance constante du dictionnaire
RèglesRègles par modèles + règles contextuellesMeilleure exactitude via structure et contexteDépend fortement de la conception des règles
CRF / MLModèle probabiliste de séquencePrécision accrue grâce à séquence et contexteNécessite des données étiquetées
ProfondApprentissage via réseaux et embeddingsPerformances sur grands ensembles variésTendance à être plus exigeant en données
HybrideRègles pour initier puis affiner par modèleVitesse + précision supérieuresIntégration de plusieurs systèmes

Pièges & confusions fréquents

  1. Confondre le NER avec l’extraction d’informations : l’extraction d’informations suit un schéma de sortie, tandis que le NER étiquette des entités dans le texte.
  2. Penser que les annotations NER sont au niveau de la phrase : les annotations sont faites au niveau du mot/token.
  3. Inverser les tags IOB : B signifie début d’entité, I signifie intérieur d’entité, et O signifie hors entité.
  4. Croire que la méthode lexicale est suffisante sans maintenance : elle devient peu fiable sans mise à jour du dictionnaire.
  5. Mélanger POS et type d’entité : POS décrit une catégorie grammaticale, tandis que Tag décrit le type d’entité (PER, LOC, DATE, etc.).
  6. Penser que la classification multi-classes évite le contexte : le cours indique que la compréhension du contexte rend la tâche difficile.

Checklist Examen

  1. Définir le NER et expliquer quels types d’entités il cherche à identifier dans du texte non structuré.
  2. Distinguer extraction d’informations et NER en reliant l’extraction d’informations à des schémas prédéfinis et formats de sortie.
  3. Décrire la méthode basée sur le lexique et donner la raison de sa faible utilisation pratique.
  4. Expliquer comment les règles en NER combinent règles basées sur les modèles morphologiques et règles contextuelles.
  5. Présenter l’idée de la classification multi-classes en NER et ce qui rend cette approche difficile pour un modèle simple.
  6. Décrire le rôle du CRF en NER en mentionnant la séquence et le contexte des mots pour la prédiction.
  7. Expliquer ce que font les word embeddings et pourquoi les approches profondes peuvent atteindre une précision plus élevée sur de grands jeux variés.
  8. Expliquer l’approche hybride en précisant l’enchaînement règles lexique puis apprentissage pour affiner.
  9. Décrire ce qu’est un jeu de données NER et préciser que l’annotation est au niveau du token et pas au niveau de la phrase.
  10. Reconnaître les tags IOB (B, I, O) et interpréter correctement leur rôle dans l’identification d’entités.
  11. Décrire la structure tabulaire typique d’un dataset NER avec Phrase, Mot, POS et Tag.
  12. Lister des types d’entités courants (PERSON, ORGANIZATION, LOCATION, DATE, TIME, MONEY, PERCENT, GPE) et expliquer pourquoi le POS est inclus.

Teste tes connaissances

Teste tes connaissances sur Introduction au Reconnaissance d'Entités Nommées avec 11 questions à choix multiples et corrections détaillées.

1. Quelle est la meilleure définition de la tâche de NER ?

2. Qu'est-ce que la tâche de Reconnaissance d'Entités Nommées (NER) dans le traitement du langage naturel?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Introduction au Reconnaissance d'Entités Nommées avec 9 flashcards interactives.

NER — définition ?

Identification et classification d’entités dans du texte non structuré

Définition de NER

Tâche d'identifier et classer entités dans texte.

Extraction d’informations — rôle ?

Produire des faits structurés selon un schéma prédéfini

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches