paper-with-me

Papers

DACCORD : un jeu de données pour la Détection Automatique d'énonCés COntRaDictoires en français

2023-06-08 · Actes de 18e Conférence en Recherche d'Information et Applications (CORIA) - 30e Conférence sur le Traitement Automatique des Langues Naturelles (TALN), Paris, France 2023 6 · Maximos Skandalis, Richard Moot, Simon Robillard

La tâche de détection automatique de contradictions logiques entre énoncés en TALN est une tâche de classification binaire, où chaque paire de phrases reçoit une étiquette selon que les deux phrases se contredisent ou non. Elle peut être utilisée afin de lutter contre la désinformation. Dans cet article, nous présentons DACCORD, un jeu de données dédié à la tâche de détection automatique de contradictions entre phrases en français. Le jeu de données élaboré est actuellement composé de 1034 paires de phrases. Il couvre les thématiques de l'invasion de la Russie en Ukraine en 2022, de la pandémie de Covid-19 et de la crise climatique. Pour mettre en avant les possibilités de notre jeu de données, nous évaluons les performances de certains modèles de transformeurs sur lui. Nous constatons qu'il constitue pour eux un défi plus élevé que les jeux de données existants pour le français, qui sont déjà peu nombreux. In NLP, the automatic detection of logical contradictions between statements is a binary classification task, in which a pair of sentences receives a label according to whether or not the two sentences contradict each other. This task has many potential applications, including combating disinformation. In this article, we present DACCORD, a new dataset dedicated to the task of automatically detecting contradictions between sentences in French. The dataset is currently composed of 1034 sentence pairs. It covers the themes of Russia's invasion of Ukraine in 2022, the Covid-19 pandemic, and the climate crisis. To highlight the possibilities of our dataset, we evaluate the performance of some recent Transformer models on it. We conclude that our dataset is considerably more challenging than the few existing datasets for French.

📄 PDF Abstract BibTeX

Code (2)

mskandalis/daccord-dataset-contradictions 공식 구현
🤗 datasets/maximoss/daccord-contradictions

Tasks

Binary ClassificationBinary text classificationSentenceSentence-Pair ClassificationText Pair Classification

Methods 이 논문이 사용한 방법론

Attention 설명 없음
Linear Layer A Linear Layer is a projection $\mathbf{XW + b}$.
Position-Wise Feed-Forward Layer 설명 없음
Label Smoothing Label Smoothing is a regularization technique that introduces noise for the labels. This accounts for the fact that datasets may have mistakes in them, so maximizing the…
Layer Normalization Unlike batch normalization, Layer Normalization directly estimates the normalization statistics from the summed inputs…
Multi-Head Attention 설명 없음
Adam 설명 없음
Absolute Position Encodings Absolute Position Encodings are a type of position embeddings for [Transformer-based models] where positional encodings are…

Similar Papers 제목 키워드 기반

DEFT 2021: Évaluation automatique de réponses courtes, une approche basée sur la sélection de traits lexicaux et augmentation de données (DEFT 2021 : Automatic short answer grading, a lexical features selection and data augmentation based approach)

2021-06-01 · JEP/TALN/RECITAL 2021 6 · Timothée Poulain, Victor Connes

Cet article présente la participation de l’équipe Proofreaders du LS2N au DÉfi Fouille de Textes 2021 (DEFT 2021). La tâche proposée consiste en la poursuite automatique de l’évaluation de réponses courtes d’étudiants (E…

automatic short answer gradingData Augmentation

Revue de la littérature : entrepôts de données biomédicales et traitement automatique de la langue (Literature review : biomedical data warehouse and natural language processing )

2021-06-01 · JEP/TALN/RECITAL 2021 6 · Adrien Bazoge

La quantité de données de santé informatisées ne cesse de croître et ouvre de nouvelles possibilités pour la recherche scientifique. L’accès à ces données passe très souvent par l’utilisation d’entrepôts de données biomé…

D\'etection automatique de phrases parall\`eles dans un corpus biom\'edical comparable technique / simplifi\'e (Automatic detection of parallel sentences in comparable biomedical corpora)

2019-07-01 · JEPTALNRECITAL 2019 7 · Remi Cardon, Natalia Grabar

Les phrases parall{\`e}les contiennent des informations identiques ou tr{\`e}s proches s{\'e}mantiquement et offrent des indications importantes sur le fonctionnement de la langue. Lorsque les phrases sont diff{\'e}renci…

...des conf\'erences enfin disons des causeries... D\'etection automatique de segments en relation de paraphrase dans les reformulations de corpus oraux

2015-06-01 · JEPTALNRECITAL 2015 6 · Natalia Grabar, Iris Eshkol

Notre travail porte sur la d{\'e}tection automatique des segments en relation de reformulation paraphrastique dans les corpus oraux. L{'}approche propos{\'e}e est une approche syntagmatique qui tient compte des marqueurs…

Relation

Pr\'ediction automatique de fonctions pragmatiques dans les reformulations (Automatic prediction of pragmatic functions in reformulations)

2016-07-01 · JEPTALNRECITAL 2016 7 · Natalia Grabar, Iris Eshkol-Taravella

La reformulation participe {\`a} la structuration du discours, notamment dans le cas des dialogues, et contribue {\'e}galement {\`a} la dynamique du discours. Reformuler est un acte significatif qui poursuit des objectif…