Tupían Language Ressources: Data, Tools, Analyses
TuLaR (Tupian Language Resources) is a project for collecting, documenting, analyzing, and developing computational and pedagogical material for low-resource Brazilian indigenous languages. It provides valuable data for language research regarding typological, syntactic, morphological, and phonological aspects. Here we present TuLaR’s databases, with special consideration to TuDeT (Tupian Dependency Treebanks), an annotated corpus under development for nine languages of the Tupian family, built upon the Universal Dependencies framework. The annotation within such a framework serves a twofold goal: enriching the linguistic documentation of the Tupian languages due to the rapid and consistent annotation, and providing computational resources for those languages, thanks to the suitability of our framework for developing NLP tools. We likewise present a related lexical database, some tools developed by the project, and examine future goals for our initiative.
Code (0)
등록된 구현이 없습니다.
Similar Papers 제목 키워드 기반
Le projet FREEM : ressources, outils et enjeux pour l’étude du français d’Ancien Régime (The F RE EM project: Resources, tools and challenges for the study of Ancien Régime French)
En dépit de leur qualité certaine, les ressources et outils disponibles pour l’analyse du français d’Ancien Régime ne sont plus à même de répondre aux enjeux de la recherche en linguistique et en littérature pour cette p…
État de l’art : Liage de ressources lexicales du français (State of the art : Linking French Lexical Resources)
Les ressources lexicales informatisées constituent des données indispensables à l’élaboration d’outils et de méthodes répondant aux différentes tâches de Traitement Automatique des Langues (TAL). Celles-ci sont hétérogèn…
Identifier et cat\'egoriser l'ambigu\"\it\'e dans les sp\'ecifications techniques de conceptions de syst\`emes (Identifying and classifying ambiguity in requirements)
Cette {\'e}tude s{'}inscrit dans le cadre d{'}une th{\`e}se Cifre avec Prometil 1 , une soci{\'e}t{\'e} qui commercialise un outil de d{\'e}tection automatique des erreurs dans les exigences, i.e. le contenu textuel des …
Construire des ressources collaboratives pour les langues peu dotées: une modélisation orientée communauté (Building collaborative resources for poorly endowed languages : community-oriented modeling )
Les applications du traitement automatique des langues (TAL) nourrissent aujourd’hui une bonne partie des langues indo-européennes en raison des corpus linguistiques de qualité disponibles en grande quantité et variété. …