paper-with-me

홈 › Papers

Traitement des Mots Hors Vocabulaire pour la Traduction Automatique de Document OCRis\'es en Arabe (This article presents a new system that automatically translates images of arabic documents)

2017-06-01 · JEPTALNRECITAL 2017 6 · Kamel Bouzidi, Zied Elloumi, Laurent Besacier, Benjamin Lecouteux, Mohamed-Faouzi Benzeghiba

Cet article pr{\'e}sente un syst{\e}me original de traduction de documents num{\'e}ris{\'e}s en arabe. Deux modules sont cascad{\'e}s : un syst{\e}me de reconnaissance optique de caract{\e}res (OCR) en arabe et un syst{\e}me de traduction automatique (TA) arabe-fran{\c{c}}ais. Le couplage OCR-TA a {\'e}t{\'e} peu abord{\'e} dans la litt{\'e}rature et l{'}originalit{\'e} de cette {\'e}tude consiste {\`a} proposer un couplage {\'e}troit entre OCR et TA ainsi qu{'}un traitement sp{\'e}cifique des mots hors vocabulaire (MHV) engendr{\'e}s par les erreurs d{'}OCRisation. Le couplage OCR-TA par treillis et notre traitement des MHV par remplacement selon une mesure composite qui prend en compte forme de surface et contexte du mot, permettent une am{\'e}lioration significative des performances de traduction. Les exp{\'e}rimentations sont r{\'e}alis{\'e}s sur un corpus de journaux num{\'e}ris{\'e}s en arabe et permettent d{'}obtenir des am{\'e}liorations en score BLEU de 3,73 et 5,5 sur les corpus de d{\'e}veloppement et de test respectivement.

📄 PDF Abstract BibTeX

Code (0)

등록된 구현이 없습니다.

Tasks

es-enOptical Character Recognition (OCR)

Similar Papers 제목 키워드 기반

Normalisation automatique du vocabulaire source pour traduire depuis une langue \`a morphologie riche (Learning Morphological Normalization for Translation from Morphologically Rich Languages)

2017-06-01 · JEPTALNRECITAL 2017 6 · Franck Burlot, Fran{\c{c}}ois Yvon

Lorsqu{'}ils sont traduits depuis une langue {\`a} morphologie riche vers l{'}anglais, les mots-formes sources contiennent des marques d{'}informations grammaticales pouvant {\^e}tre jug{\'e}es redondantes par rapport {\…

Une approche hybride pour la construction de lexiques bilingues d'expressions multi-mots \`a partir de corpus parall\`eles (A hybrid approach to build bilingual lexicons of multiword expressions from parallel corpora)

2017-06-01 · JEPTALNRECITAL 2017 6

Les expressions multi-mots jouent un r{\^o}le important dans diff{\'e}rentes applications du Traitement Automatique de la Langue telles que la traduction automatique et la recherche d{'}information interlingue. Cet artic…

Repr\'esentations continues d\'eriv\'ees des caract\`eres pour un mod\`ele de langue neuronal \`a vocabulaire ouvert (Opening the vocabulary of neural language models with character-level word representations)

2017-06-01 · JEPTALNRECITAL 2017 6 · Matthieu Labeau, Alex Allauzen, re

Cet article propose une architecture neuronale pour un mod{\`e}le de langue {\`a} vocabulaire ouvert. Les repr{\'e}sentations continues des mots sont calcul{\'e}es {\`a} la vol{\'e}e {\`a} partir des caract{\`e}res les c…

RerankingSENTER

L'optimisation du plongement de mots pour le fran\ccais : une application de la classification des phrases (Optimization of Word Embeddings for French : an Application of Sentence Classification)

2018-05-01 · JEPTALNRECITAL 2018 5 · Jungyeul Park

Nous proposons trois nouvelles m{\'e}thodes pour construire et optimiser des plongements de mots pour le fran{\c{c}}ais. Nous utilisons les r{\'e}sultats de l{'}{\'e}tiquetage morpho-syntaxique, de la d{\'e}tection des e…

General ClassificationSentenceSentence ClassificationWord Embeddings

Intérêt des modèles de caractères pour la détection d’événements (The interest of character-level models for event detection)

2021-06-01 · JEP/TALN/RECITAL 2021 6 · Emanuela Boros, Romaric Besançon, Olivier Ferret, Brigitte Grau

Cet article aborde la tâche de détection d’événements, visant à identifier et catégoriser les mentions d’événements dans les textes. Une des difficultés de cette tâche est le problème des mentions d’événements correspond…

Event Detection