Simulation d’erreurs d’OCR dans les systèmes de TAL pour le traitement de données anachroniques (Simulation of OCR errors in NLP systems for processing anachronistic data)
L’extraction d’information offre de nouvelles perspectives au sein des recherches historiques. Cependant, la majorité des recherches liées à ce domaine s’effectue sur des données contemporaines. Malgré l’évolution constante des systèmes d’OCR, les textes historiques résultant de ce procédé contiennent toujours de multiples erreurs. Du fait d’un manque de ressources historiques dédiées au TAL, le traitement de ce domaine reste dépendant de l’utilisation de ressources contemporaines. De nombreuses études ont démontré l’impact négatif que pouvaient avoir les erreurs d’OCR sur les systèmes prêts à l’emploi contemporains. Mais l’évaluation des nouvelles architectures, proposant des résultats prometteurs sur des données récentes, face à ce problème reste encore très minime. Dans cette étude, nous quantifions l’impact des erreurs d’OCR sur trois tâches d’extraction d’information en utilisant plusieurs architectures de type Transformers. Au vu de ces résultats, nous proposons une approche permettant de réduire de plus de 50% cet impact sans avoir recours à des ressources historiques spécialisées.
Code (0)
등록된 구현이 없습니다.
Tasks
Optical Character Recognition (OCR)Similar Papers 제목 키워드 기반
D\'etection d'erreurs dans des transcriptions OCR de documents historiques par r\'eseaux de neurones r\'ecurrents multi-niveau (Combining character level and word level RNNs for post-OCR error detection)
Le traitement {\`a} posteriori de transcriptions OCR cherche {\`a} d{\'e}tecter les erreurs dans les sorties d{'}OCR pour tenter de les corriger, deux t{\^a}ches {\'e}valu{\'e}es par la comp{\'e}tition ICDAR-2017 Post-OC…
Optical Character Recognition (OCR)\'Etude des verbes introducteurs de noms de m\'edicaments dans les forums de sant\'e
Dans cet article, nous combinons annotations manuelle et automatique pour identifier les verbes utilis{\'e}s pour introduire un m{\'e}dicament dans les messages sur les forums de sant{\'e}. Cette information est notammen…
Utilisation des repr\'esentations continues des mots et des param\`etres prosodiques pour la d\'etection d'erreurs dans les transcriptions automatiques de la parole (Combining continuous word representation and prosodic features for ASR error detection)
R{\'e}cemment, l{'}utilisation des repr{\'e}sentations continues de mots a connu beaucoup de succ{\`e}s dans plusieurs t{\^a}ches de traitement du langage naturel. Dans cet article, nous proposons d{'}{\'e}tudier leur ut…
ACCOLÉ : Annotation Collaborative d’erreurs de traduction pour COrpus aLignÉs, multi-cibles, et Annotation d’Expressions Poly-lexicales (ACCOLÉ: A Collaborative Platform of Error Annotation for Aligned)
Cette démonstration présente les avancées d’ACCOLÉ (Annotation Collaborative d’erreurs de traduction pour COrpus aLignÉs), qui en plus de proposer une gestion simplifiée des corpus et des typologies d’erreurs, l’annotati…
Auto-correction dans un analyseur neuronal par transitions : un comportement factice ? (Self-correction in a transition-based neural parser : a spurious behaviour ?)
Cette étude explore la capacité d’auto-correction dans le cas d’un analyseur neuronal par transitions. Nous définissons un oracle dynamique pour le système étudié lui apprenant à s’auto-corriger. Les performances du modè…