paper-with-me

홈 › Papers

D\'ecodeur neuronal pour la transcription de documents manuscrits anciens (Neural decoder for the transcription of historical handwritten documents)

2018-05-01 · JEPTALNRECITAL 2018 5 · Adeline Granet, Emmanuel Morin, Harold Mouch{\`e}re, Solen Quiniou, Christian Viard-Gaudin

L{'}absence de donn{\'e}es annot{\'e}es peut {\^e}tre une difficult{\'e} majeure lorsque l{'}on s{'}int{\'e}resse {\a} l{'}analyse de documents manuscrits anciens. Pour contourner cette difficult{\'e}, nous proposons de diviser le probl{\e}me en deux, afin de pouvoir s{'}appuyer sur des donn{\'e}es plus facilement accessibles. Dans cet article nous pr{\'e}sentons la partie d{\'e}codeur d{'}un encodeur-d{\'e}codeur multimodal utilisant l{'}apprentissage par transfert de connaissances pour la transcription des titres de pi{\e}ces de la Com{\'e}die Italienne. Le d{\'e}codeur transforme un vecteur de n-grammes au niveau caract{\e}res en une s{\'e}quence de caract{\e}res correspondant {\a} un mot. L{'}apprentissage par transfert de connaissances est r{\'e}alis{\'e} principalement {\a} partir d{'}une nouvelle ressource inexploit{\'e}e contemporaine {\a} la Com{\'e}die-Italienne et th{\'e}matiquement proche ; ainsi que d{'}autres ressources couvrant d{'}autres domaines, des langages diff{\'e}rents et m{\^e}me des p{\'e}riodes diff{\'e}rentes. Nous obtenons 97,27{\%} de caract{\e}res bien reconnus sur les donn{\'e}es de la Com{\'e}die-Italienne, ainsi que 86,57{\%} de mots correctement g{\'e}n{\'e}r{\'e}s malgr{\'e} une couverture de 67,58{\%} uniquement entre la Com{\'e}die-Italienne et l{'}ensemble d{'}apprentissage. Les exp{\'e}riences montrent qu{'}un tel syst{\e}me peut {\^e}tre une approche efficace dans le cadre d{'}apprentissage par transfert.

📄 PDF Abstract BibTeX

Code (0)

등록된 구현이 없습니다.

Tasks

Decoder

Similar Papers 제목 키워드 기반

Exploiter des mod\`eles de langue pour \'evaluer des sorties de logiciels d'OCR pour des documents fran\ccais du XVIIe si\`ecle ()

2020-06-01 · JEPTALNRECITAL 2020 6 · Jean-Baptiste Tanguy

Pour comparer deux sorties de logiciels d{'}OCR, le Character Error Rate (ou, CER) est fr{\'e}quemment utilis{\'e}. Moyennant l{'}existence d{'}une transcription de r{\'e}f{\'e}rence de qualit{\'e} pour certains document…

Optical Character Recognition (OCR)

Utilisation des repr\'esentations continues des mots et des param\`etres prosodiques pour la d\'etection d'erreurs dans les transcriptions automatiques de la parole (Combining continuous word representation and prosodic features for ASR error detection)

2016-07-01 · JEPTALNRECITAL 2016 7 · Sahar Ghannay, Yannick Est{\`e}ve, Nathalie Camelin, Camille Dutrey 외

R{\'e}cemment, l{'}utilisation des repr{\'e}sentations continues de mots a connu beaucoup de succ{\`e}s dans plusieurs t{\^a}ches de traitement du langage naturel. Dans cet article, nous proposons d{'}{\'e}tudier leur ut…

Segmentation de texte non-supervis\'ee pour la d\'etection de th\'ematiques \`a l'aide de plongements lexicaux (Unsupervised text segmentation for topic detection using embeddings )

2020-06-01 · JEPTALNRECITAL 2020 6 · Alex Benamar, ra

Cet article pr{\'e}sente les principales m{\'e}thodes de segmentation automatique de documents textuels sp{\'e}cifiques. La t{\^a}che de segmentation th{\'e}matique de texte consiste {\`a} analyser un document pour en ex…

SegmentationSENTERText Segmentation

Auto-encodeurs pour la compr\'ehension de documents parl\'es (Auto-encoders for Spoken Document Understanding)

2016-07-01 · JEPTALNRECITAL 2016 7 · Killian Janod, Mohamed Morchid, Richard Dufour, Georges Linar{\`e}s 외

Les repr{\'e}sentations de documents au moyen d{'}approches {\`a} base de r{\'e}seaux de neurones ont montr{\'e} des am{\'e}liorations significatives dans de nombreuses t{\^a}ches du traitement du langage naturel. Dans l…

document understanding

R\'eutilisation de Textes dans les Manuscrits Anciens (Text Reuse in Ancient Manuscripts)

2019-07-01 · JEPTALNRECITAL 2019 7 · Amir Hazem, B{\'e}atrice Daille, Dominique Stutzmann, Jacob Currie 외

Nous nous int{\'e}ressons dans cet article {\`a} la probl{\'e}matique de r{\'e}utilisation de textes dans les livres liturgiques du Moyen {\^A}ge. Plus particuli{\`e}rement, nous {\'e}tudions les variations textuelles de…