paper-with-me

홈 › Papers

Reconnaissance d’entités nommées sur des sorties OCR bruitées : des pistes pour la désambiguïsation morphologique automatique (Resolution of entity linking issues on noisy OCR output : automatic disambiguation tracks)

2022-06-01 · JEP/TALN/RECITAL 2022 6 · Caroline Koudoro-Parfait, Gaël Lejeune, Richy Buth

La variation dans les données textuelles, en particulier le bruit, est un facteur limitant la performance des systèmes de Reconnaissance d’Entités Nommées (REN). Les systèmes de REN sont en effet généralement entraînés sur des données « propres », non-bruitées, ce qui n’est pas le cas des données des humanités numériques obtenues par reconnaissance optique de caractères (OCR). De fait, la qualité des transcriptions OCR est souvent perçue comme la source principale des erreurs faites par les outils de REN. Cependant, des résultats obtenus avec différents systèmes REN sur des transcriptions OCR d’un corpus du 19ème siècle (ELTeC) tendent à montrer une certaine robustesse, modulo la présence de formes bruitées, parfois dites « contaminées ». La difficulté, est alors de lier ces formes contaminées avec leur forme de référence, par exemple, pour rapprocher la chaîne « Parisl »et la chaîne « Paris ». Il s’agit de modéliser le fait que différentes variations se rapprochent du même terme. Des questions quant à l’automatisation de cette tâche et sa généralisation à toutes les variations d’un même terme restent ouvertes. Nous montrons dans cet article différentes expériences visant à traiter ce problème sous l‘angle de la désambiguïsation morphologique des entités nommées (EN) en aval de la chaîne de traitement, plutôt que par la correction en amont des données de l’OCR.

📄 PDF Abstract BibTeX

Code (0)

등록된 구현이 없습니다.

Tasks

Entity LinkingOptical Character Recognition (OCR)

Similar Papers 제목 키워드 기반

Comparaison de listes d'erreurs de transcription automatique de la parole : quelle compl\'ementarit\'e entre les diff\'erentes m\'etriques ? (Comparing error lists for ASR systems : contribution of different metrics)

2016-07-01 · JEPTALNRECITAL 2016 7 · Olivier Galibert, Juliette Kahn, Sophie Rosset

Le travail que nous pr{\'e}sentons ici s{'}inscrit dans le domaine de l{'}{\'e}valuation des syst{\`e}mes de reconnaissance automatique de la parole en vue de leur utilisation dans une t{\^a}che aval, ici la reconnaissan…

Syst\`eme hybride pour la reconnaissance des entit\'es nomm\'ees arabes \`a base des CRF (Hybrid arabic NER system using CRF Model)

2016-07-01 · JEPTALNRECITAL 2016 7 · Emna Hkiri, Souheyl Mallat, Mounir Zrigui

La reconnaissance d{'}entit{\'e}s nomm{\'e}es (REN) pour les langues naturelles telles que l{'}arabe est une t{\^a}che essentielle et difficile. Dans cet article, nous d{\'e}crivons notre syst{\`e}me hybride afin d{'}am{…

NER

NERAM : Named Entity Recognition for AMazighe language (RENAM: Syst\`eme de Reconnaissance des Entit\'es Nomm\'ees Amazighes) [in French]

2014-07-01 · JEPTALNRECITAL 2014 7 · Meryem Talha, Siham Boulaknadel, Driss Aboutajdine
named-entity-recognitionNamed Entity RecognitionNamed Entity Recognition (NER)

Le benchmarking de la reconnaissance d'entit\'es nomm\'ees pour le fran\ccais (Benchmarking for French NER)

2018-05-01 · JEPTALNRECITAL 2018 5 · Jungyeul Park

Cet article pr{\'e}sente une t{\^a}che du benchmarking de la reconnaissance de l{'}entit{\'e} nomm{\'e}e (REN) pour le fran{\c{c}}ais. Nous entrainons et {\'e}valuons plusieurs algorithmes d{'}{\'e}tiquetage de s{\'e}que…

BenchmarkingNER

Mining Partial Annotation Rules for Named Entity Recognition (Fouille de r\`egles d'annotation partielles pour la reconnaissance des entit\'es nomm\'ees) [in French]

2013-06-01 · JEPTALNRECITAL 2013 6 · Damien Nouvel, Jean-Yves Antoine, Nathalie Friburger, Arnaud Soulet
Information Retrievalnamed-entity-recognitionNamed Entity RecognitionNamed Entity Recognition (NER)