paper-with-me

Papers

TREMoLo : un corpus multi-étiquettes de tweets en français pour la caractérisation des registres de langue (TREMoLo : a Multi-Label Corpus of French Tweets for Language Register Characterization)

2021-06-01 · JEP/TALN/RECITAL 2021 6 · Jade Mekki, Delphine Battistelli, Nicolas Béchet, Gwénolé Lecorvé

Des registres tels que familier, courant et soutenu sont un phénomène immédiatement perceptible par tout locuteur d’une langue. Ils restent encore peu étudiés en traitement des langues (TAL), en particulier en dehors de l’anglais. Cet article présente un large corpus de tweets en français annotés en registres de langue. L’annotation intègre des marqueurs propres à ce type de textes (tels que les émoticônes ou les hashtags) et habituellement évincés dans les travaux en TAL. À partir d’une graine annotée manuellement en proportion d’appartenance aux registres, un classifieur de type CamemBERT est appris et appliqué sur un large ensemble de tweets. Le corpus annoté en résultant compte 228 505 tweets pour un total de 6 millions de mots. Des premières analyses statistiques sont menées et permettent de conclure à la qualité du corpus présenté. Le corpus ainsi que son guide d’annotation sont mis à la disposition de la communauté scientifique.

📄 PDF Abstract BibTeX

Code (0)

등록된 구현이 없습니다.

Similar Papers 제목 키워드 기반

TREMoLo-Tweets: A Multi-Label Corpus of French Tweets for Language Register Characterization

2021-09-01 · RANLP 2021 9 · Jade Mekki, Gwénolé Lecorvé, Delphine Battistelli, Nicolas Béchet

The casual, neutral, and formal language registers are highly perceptible in discourse productions. However, they are still poorly studied in Natural Language Processing (NLP), especially outside English, and for new tex…

Etiquetage morpho-syntaxique de tweets avec des CRF

2015-06-01 · JEPTALNRECITAL 2015 6 · Tian Tian, Dinarelli Marco, Tellier Isabelle, Cardoso Pedro

Nous nous int{\'e}ressons dans cet article {\`a} l{'}apprentissage automatique d{'}un {\'e}tiqueteur mopho-syntaxique pour les tweets en anglais. Nous proposons tout d{'}abord un jeu d{'}{\'e}tiquettes r{\'e}duit avec 17…

Une note sur l'analyse du constituant pour le fran\ccais (A Note on constituent parsing for French)

2018-05-01 · JEPTALNRECITAL 2018 5 · Jungyeul Park

Cet article traite des analyses d{'}erreurs quantitatives et qualitatives sur les r{\'e}sultats de l{'}analyse syntaxique des constituants pour le fran{\c{c}}ais. Pour cela, nous {\'e}tendons l{'}approche de Kummerfeld e…

FENEC : un corpus équilibré pour l’évaluation des entités nommées en français (FENEC : a balanced sample corpus for French named entity recognition )

2022-06-01 · JEP/TALN/RECITAL 2022 6 · Alice Millour, Yoann Dupont, Alexane Jouglar, Karën Fort

Nous présentons ici FENEC (FrEnch Named-entity Evaluation Corpus), un corpus à échantillons équilibrés contenant six genres, annoté en entités nommées selon le schéma fin Quæro. Les caractéristiques de ce corpus nous per…

named-entity-recognitionNamed Entity RecognitionNamed Entity Recognition (NER)

EtiCor: Corpus for Analyzing LLMs for Etiquettes

2023-10-29 · Ashutosh Dwivedi, Pradhyumna Lavania, Ashutosh Modi

Etiquettes are an essential ingredient of day-to-day interactions among people. Moreover, etiquettes are region-specific, and etiquettes in one region might contradict those in other regions. In this paper, we propose Et…

Sensitivity