\'Etiquetage multilingue en parties du discours avec MElt (Multilingual part-of-speech tagging with MElt)
Nous pr{\'e}sentons des travaux r{\'e}cents r{\'e}alis{\'e}s autour de MElt, syst{\e}me discriminant d{'}{\'e}tiquetage en parties du discours. MElt met l{'}accent sur l{'}exploitation optimale d{'}informations lexicales externes pour am{\'e}liorer les performances des {\'e}tiqueteurs par rapport aux mod{\e}les entra{\^\i}n{\'e}s seulement sur des corpus annot{\'e}s. Nous avons entra{\^\i}n{\'e} MElt sur plus d{'}une quarantaine de jeux de donn{\'e}es couvrant plus d{'}une trentaine de langues. Compar{\'e} au syst{\e}me {\'e}tat-de-l{'}art MarMoT, MElt obtient en moyenne des r{\'e}sultats l{\'e}g{\e}rement moins bons en l{'}absence de lexique externe, mais meilleurs lorsque de telles ressources sont disponibles, produisant ainsi des {\'e}tiqueteurs {\'e}tat-de-l{'}art pour plusieurs langues.
Code (0)
등록된 구현이 없습니다.
Tasks
Part-Of-Speech TaggingSimilar Papers 제목 키워드 기반
R\'epliquer et \'etendre pour l'alsacien ``\'Etiquetage en parties du discours de langues peu dot\'ees par sp\'ecialisation des plongements lexicaux'' (Replicating and extending for Alsatian : ``POS tagging for low-resource languages by adapting word embeddings'')
Nous pr{\'e}sentons ici les r{\'e}sultats d{'}un travail de r{\'e}plication et d{'}extension pour l{'}alsacien d{'}une exp{\'e}rience concernant l{'}{\'e}tiquetage en parties du discours de langues peu dot{\'e}es par sp{…
POSPOS TaggingWord Embeddings\'Etiquetage en parties du discours de langues peu dot\'ees par sp\'ecialisation des plongements lexicaux (POS tagging for low-resource languages by adapting word embeddings )
Cet article pr{\'e}sente une nouvelle m{\'e}thode d{'}{\'e}tiquetage en parties du discours adapt{\'e}e aux langues peu dot{\'e}es : la d{\'e}finition du contexte utilis{\'e} pour construire les plongements lexicaux est …
POSPOS TaggingWord EmbeddingsFine-tuning de modèles de langues pour la veille épidémiologique multilingue avec peu de ressources (Fine-tuning Language Models for Low-resource Multilingual Epidemic Surveillance)
Les modèles de langues pré-entraînés connaissent un très grand succès en TAL, en particulier dans les situations où l’on dispose de suffisamment de données d’entraînement. Cependant, il reste difficile d’obtenir des résu…
Etiquetage morpho-syntaxique de tweets avec des CRF
Nous nous int{\'e}ressons dans cet article {\`a} l{'}apprentissage automatique d{'}un {\'e}tiqueteur mopho-syntaxique pour les tweets en anglais. Nous proposons tout d{'}abord un jeu d{'}{\'e}tiquettes r{\'e}duit avec 17…
Lecture bilingue augment\'ee par des alignements multi-niveaux (Augmenting bilingual reading with alignment information)
Le travail qui a conduit {\`a} cette d{\'e}monstration combine des outils de traitement des langues multilingues, en particulier l{'}alignement automatique, avec des techniques de visualisation et d{'}interaction. Il vis…