Vers une solution l\'eg\`ere de production de donn\'ees pour le TAL : cr\'eation d'un tagger de l'alsacien par crowdsourcing b\'en\'evole (Toward a lightweight solution to the language resources bottleneck issue: creating a POS tagger for Alsatian using voluntary crowdsourcing)
Nous pr{\'e}sentons ici les r{\'e}sultats d{'}une exp{\'e}rience men{\'e}e sur l{'}annotation en parties du discours d{'}un corpus d{'}une langue r{\'e}gionale encore peu dot{\'e}e, l{'}alsacien, via une plateforme de myriadisation (crowdsourcing) b{\'e}n{\'e}vole d{\'e}velopp{\'e}e sp{\'e}cifiquement {\a} cette fin : Bisame1 . La plateforme, mise en ligne en mai 2016, nous a permis de recueillir 15 846 annotations gr{\^a}ce {\a} 42 participants. L{'}{\'e}valuation des annotations, r{\'e}alis{\'e}e sur un corpus de r{\'e}f{\'e}rence, montre que la F-mesure des annotations volontaires est de 0, 93. Le tagger entra{\^\i}n{\'e} sur le corpus annot{\'e} atteint lui 82 {\%} d{'}exactitude. Il s{'}agit du premier tagger sp{\'e}cifique {\a} l{'}alsacien. Cette m{\'e}thode de d{\'e}veloppement de ressources langagi{\e}res est donc efficace et prometteuse pour certaines langues peu dot{\'e}es, dont un nombre suffisant de locuteurs est connect{\'e} et actif sur le Web. Le code de la plateforme, le corpus annot{\'e} et le tagger sont librement disponibles.
Code (0)
등록된 구현이 없습니다.
Tasks
POSSimilar Papers 제목 키워드 기반
Nouvelles pistes pour revisiter la production de la parole et son d\'eveloppement : donn\'ees, mod\`eles, repr\'esentation (New tracks to revisit speech production and speech development: data, models and representation) [in French]
Revue de la littérature : entrepôts de données biomédicales et traitement automatique de la langue (Literature review : biomedical data warehouse and natural language processing )
La quantité de données de santé informatisées ne cesse de croître et ouvre de nouvelles possibilités pour la recherche scientifique. L’accès à ces données passe très souvent par l’utilisation d’entrepôts de données biomé…
Extraction automatique de contour de l\`evre \`a partir du mod\`ele CLNF (Automatic lip contour extraction using CLNF model)
Dans cet article nous proposons une nouvelle solution pour extraire le contour interne des l{\`e}vres d{'}un locuteur sans utiliser d{'}artifices. La m{\'e}thode s{'}appuie sur un algorithme r{\'e}cent d{'}extraction du …
Cr\'eation automatique d'une grammaire syntaxico-s\'emantique (Syntactic-semantic grammar automatic creation)
Nous proposons une nouvelle m{\'e}thode pour la cr{\'e}ation automatique de grammaires lexicalis{\'e}es syntaxico-s{\'e}mantiques. A l{'}heure actuelle, la cr{\'e}ation de grammaire r{\'e}sulte soit d{'}un travail manuel…
\'Etude de l'apprentissage par transfert de syst\`emes de traduction automatique neuronaux (Study on transfer learning in neural machine translation )
L{'}apprentissage par transfert est une solution au probl{\`e}me de l{'}apprentissage de syst{\`e}mes de traduction automatique neuronaux pour des paires de langues peu dot{\'e}es. Dans cet article, nous proposons une an…
Machine TranslationTransfer Learning