Toolbox : une chaîne de traitement de corpus pour les humanités numériques (Toolbox : a corpus processing pipeline for digital humanities)
Le projet Toolbox propose une chaîne de traitement pour la manipulation et le traitement de corpus textuels incluant la numérisation (OCR/HTR), la conversion au format TEI, la fouille de texte (reconnaissance d’entités nommées) et la visualisation de données. Les fonctionnalités sont accessibles via une interface en ligne qui sert de surcouche graphique à des scripts développés par nos soins ou utilisant des outils externes. Elles permettent d’automatiser les tâches élémentaires de traitement de corpus pour les chercheurs en humanités numériques. Cet outil est ouvert aux contributions externes.
Code (0)
등록된 구현이 없습니다.
Tasks
HTROptical Character Recognition (OCR)Similar Papers 제목 키워드 기반
Traitement automatique des formes m\'etriques des textes versifi\'es
L{'}objectif de cet article est de pr{\'e}senter tout d{'}abord dans ses grandes lignes le projet Anam{\`e}tre qui a pour objet le traitement automatique des formes m{\'e}triques de la po{\'e}sie et du th{\'e}{\^a}tre fr…
SENTERG\'en\'erer une grammaire d'arbres adjoints pour l'arabe \`a partir d'une m\'eta-grammaire (Generate a tree adjoining grammar for arabic from a meta-grammar)
La raret{\'e} des ressources num{\'e}riques pour la langue arabe, telles que les grammaires et corpus, rend son traitement plus difficile que les autres langues naturelles. A ce jour il n{'}existe pas une grammaire forme…
Simplification automatique de texte dans un contexte de faibles ressources (Automatic Text Simplification : Approaching the Problem in Low Resource Settings for French)
La simplification de textes a {\'e}merg{\'e} comme un sous-domaine actif du traitement automatique des langues, du fait des probl{\`e}mes pratiques et th{\'e}oriques qu{'}elle permet d{'}aborder, ainsi que de ses nombreu…
Text SimplificationSimulation d’erreurs d’OCR dans les systèmes de TAL pour le traitement de données anachroniques (Simulation of OCR errors in NLP systems for processing anachronistic data)
L’extraction d’information offre de nouvelles perspectives au sein des recherches historiques. Cependant, la majorité des recherches liées à ce domaine s’effectue sur des données contemporaines. Malgré l’évolution consta…
Optical Character Recognition (OCR)Reconnaissance d’entités nommées sur des sorties OCR bruitées : des pistes pour la désambiguïsation morphologique automatique (Resolution of entity linking issues on noisy OCR output : automatic disambiguation tracks)
La variation dans les données textuelles, en particulier le bruit, est un facteur limitant la performance des systèmes de Reconnaissance d’Entités Nommées (REN). Les systèmes de REN sont en effet généralement entraînés s…
Entity LinkingOptical Character Recognition (OCR)