Représentations lexicales pour la détection non supervisée d'événements dans un flux de tweets : étude sur des corpus français et anglais
In this work, we evaluate the performance of recent text embeddings for the automatic detection of events in a stream of tweets. We model this task as a dynamic clustering problem.Our experiments are conducted on a publicly available corpus of tweets in English and on a similar dataset in French annotated by our team. We show that recent techniques based on deep neural networks (ELMo, Universal Sentence Encoder, BERT, SBERT), although promising on many applications, are not very suitable for this task. We also experiment with different types of fine-tuning to improve these results on French data. Finally, we propose a detailed analysis of the results obtained, showing the superiority of tf-idf approaches for this task.
Code (1)
Tasks
ClusteringSentenceMethods 이 논문이 사용한 방법론
Similar Papers 제목 키워드 기반
Analyse en dépendances du français avec des plongements contextualisés (French dependency parsing with contextualized embeddings)
Cet article présente un analyseur syntaxique en dépendances pour le français qui se compare favorablement à l’état de l’art sur la plupart des corpus de référence. L’analyseur s’appuie sur de riches représentations lexic…
Dependency ParsingACCOLÉ : Annotation Collaborative d’erreurs de traduction pour COrpus aLignÉs, multi-cibles, et Annotation d’Expressions Poly-lexicales (ACCOLÉ: A Collaborative Platform of Error Annotation for Aligned)
Cette démonstration présente les avancées d’ACCOLÉ (Annotation Collaborative d’erreurs de traduction pour COrpus aLignÉs), qui en plus de proposer une gestion simplifiée des corpus et des typologies d’erreurs, l’annotati…
DisMo : un annotateur multi-niveaux pour les corpus oraux
Dans cette d{\'e}monstration, nous pr{\'e}sentons l{'}annotateur multi-niveaux DisMo, un outil con{\c{c}}u pour faire face aux sp{\'e}cificit{\'e}s des corpus oraux. Il fournit une annotation morphosyntaxique, une lemmat…
Repr\'esentation vectorielle de paires de verbes pour la pr\'ediction de relations lexicales (Verb-pairs embeddings for discourse relation prediction)
Dans cet article, nous proposons un mod{\`e}le de repr{\'e}sentations vectorielles de paire de mots, obtenues {\`a} partir d{'}une adaptation du mod{\`e}le Skip-gram de Word2vec. Ce mod{\`e}le est utilis{\'e} pour g{\'e}…
Relation PredictionPlongements Interprétables pour la Détection de Biais Cachés (Interpretable Embeddings for Hidden Biases Detection)
De nombreuses tâches sémantiques en TAL font usage de données collectées de manière semiautomatique, ce qui est souvent source d’artefacts indésirables qui peuvent affecter négativement les modèles entraînés sur celles-c…