Apprentissage interactif de règles d'extraction d'information textuelle

Sondes Bannour

Thèse Année : 2015

Iteractive learning of textual information extraction rules

Apprentissage interactif de règles d'extraction d'information textuelle

(1)

Sondes Bannour

Fonction : Auteur
PersonId : 1293809
IdHAL : sondes-bannour-souihi
ORCID : 0009-0005-6203-5406

Laboratoire d'Informatique de Paris-Nord

Résumé

Non communiqué

L’Extraction d’Information est une discipline qui a émergé du Traitement Automatique des Langues afin de proposer des analyses fines d’un texte écrit en langage naturel et d’améliorer la recherche d’informations spécifiques. Les techniques d’extraction d’information ont énormément évolué durant les deux dernières décennies.Les premiers systèmes d’extraction d’information étaient des systèmes à base de règles écrites manuellement. L’écriture manuelle des règles étant devenue une tâche fastidieuse, des algorithmes d’apprentissage automatique de règles ont été développés.Ces algorithmes nécessitent cependant la rédaction d’un guide d’annotation détaillé, puis l’annotation manuelle d’une grande quantité d’exemples d’entraînement. Pour minimiser l’effort humain requis dans les deux familles d’approches de mise au point de règles, nous avons proposé, dans ce travail de thèse, une approche hybride qui combine les deux en un seul système interactif qui procède en plusieurs itérations.Ce système que nous avons nommé IRIES permet à l’utilisateur de travailler de manière duale sur les règles d’extraction d’information et les exemples d’apprentissage.Pour mettre en place l’approche proposée, nous avons proposé une chaîne d’annotation linguistique du texte et l’utilisation d’un langage de règles expressif pour la compréhensibilité et la généricité des règles écrites ou inférées, une stratégie d’apprentissage sur un corpus réduit pour ne pas discriminer les exemples positifs non encore annotés à une itération donnée, la mise en place d’un concordancier pour l’écriture de règles prospectives et la mise en place d’un module d’apprentissage actif(IAL4Sets) pour une sélection intelligente d’exemples.Ces propositions ont été mises en place et évaluées sur deux corpus : le corpus de BioNLP-ST 2013 et le corpus SyntSem. Une étude de différentes combinaisons de traits linguistiques utilisés dans les expressions des règles a permis de voir l’impactde ces traits sur les performances des règles. L’apprentissage sur un corpus réduit a permis un gain considérable en temps d’apprentissage sans dégradationde performances. Enfin, le module d’apprentissage actif proposé (IAL4Sets) a permis d’améliorer les performances de l’apprentissage actif de base de l’algorithme WHISK grâce à l’introduction de la notion de distance ou de similarité distributionnelle qui permet de proposer à l’utilisateur des exemples sémantiquement proches des exemples positifs déjà couverts.

Mots clés

Information extraction rules

Extraction d'information

Domaines

Apprentissage [cs.LG] Informatique et langage [cs.CL]

Fichier principal

edgalilee_th_2015_bannour.pdf (12.75 Mo)

Origine : Version validée par le jury (STAR)

ABES STAR : Contact

https://theses.hal.science/tel-02180540

Soumis le : jeudi 11 juillet 2019-15:09:09

Dernière modification le : vendredi 13 octobre 2023-08:40:19

Dates et versions

tel-02180540 , version 1 (11-07-2019)

Identifiants

HAL Id : tel-02180540 , version 1

Citer

Sondes Bannour. Apprentissage interactif de règles d'extraction d'information textuelle. Apprentissage [cs.LG]. Université Sorbonne Paris Cité, 2015. Français. ⟨NNT : 2015USPCD113⟩. ⟨tel-02180540⟩

Exporter

BibTeX XML-TEI Dublin Core DC Terms EndNote DataCite

Collections

UNIV-PARIS13 CNRS STAR LIPN GALILE SORBONNE-PARIS-NORD

213 Consultations

204 Téléchargements

Iteractive learning of textual information extraction rules

Apprentissage interactif de règles d'extraction d'information textuelle

Résumé

Mots clés

Domaines

Dates et versions

Identifiants

Citer

Exporter

Collections

Partager