Reconnaissance d’entités nommées sur des sorties OCR bruitées : des pistes pour la désambiguïsation morphologique automatique (Resolution of entity linking issues on noisy OCR output : automatic disambiguation tracks)
La variation dans les données textuelles, en particulier le bruit, est un facteur limitant la performance des systèmes de Reconnaissance d’Entités Nommées (REN). Les systèmes de REN sont en effet généralement entraînés sur des données « propres », non-bruitées, ce qui n’est pas le cas des données des humanités numériques obtenues par reconnaissance optique de caractères (OCR). De fait, la qualité des transcriptions OCR est souvent perçue comme la source principale des erreurs faites par les outils de REN. Cependant, des résultats obtenus avec différents systèmes REN sur des transcriptions OCR d’un corpus du 19ème siècle (ELTeC) tendent à montrer une certaine robustesse, modulo la présence de formes bruitées, parfois dites « contaminées ». La difficulté, est alors de lier ces formes contaminées avec leur forme de référence, par exemple, pour rapprocher la chaîne « Parisl »et la chaîne « Paris ». Il s’agit de modéliser le fait que différentes variations se rapprochent du même terme. Des questions quant à l’automatisation de cette tâche et sa généralisation à toutes les variations d’un même terme restent ouvertes. Nous montrons dans cet article différentes expériences visant à traiter ce problème sous l‘angle de la désambiguïsation morphologique des entités nommées (EN) en aval de la chaîne de traitement, plutôt que par la correction en amont des données de l’OCR.
Code (0)
등록된 구현이 없습니다.
Tasks
Entity LinkingOptical Character Recognition (OCR)Similar Papers 제목 키워드 기반
Comparaison de listes d'erreurs de transcription automatique de la parole : quelle compl\'ementarit\'e entre les diff\'erentes m\'etriques ? (Comparing error lists for ASR systems : contribution of different metrics)
Le travail que nous pr{\'e}sentons ici s{'}inscrit dans le domaine de l{'}{\'e}valuation des syst{\`e}mes de reconnaissance automatique de la parole en vue de leur utilisation dans une t{\^a}che aval, ici la reconnaissan…
Syst\`eme hybride pour la reconnaissance des entit\'es nomm\'ees arabes \`a base des CRF (Hybrid arabic NER system using CRF Model)
La reconnaissance d{'}entit{\'e}s nomm{\'e}es (REN) pour les langues naturelles telles que l{'}arabe est une t{\^a}che essentielle et difficile. Dans cet article, nous d{\'e}crivons notre syst{\`e}me hybride afin d{'}am{…
NERNERAM : Named Entity Recognition for AMazighe language (RENAM: Syst\`eme de Reconnaissance des Entit\'es Nomm\'ees Amazighes) [in French]
Le benchmarking de la reconnaissance d'entit\'es nomm\'ees pour le fran\ccais (Benchmarking for French NER)
Cet article pr{\'e}sente une t{\^a}che du benchmarking de la reconnaissance de l{'}entit{\'e} nomm{\'e}e (REN) pour le fran{\c{c}}ais. Nous entrainons et {\'e}valuons plusieurs algorithmes d{'}{\'e}tiquetage de s{\'e}que…
BenchmarkingNER