La génération de textes artificiels en substitution ou en complément de données d’apprentissage (Generating artificial texts as substitution or complement of training data )
La qualité des textes générés artificiellement s’est considérablement améliorée avec l’apparition des transformers. La question d’utiliser ces modèles pour augmenter les données d’apprentissage pour des tâches d’apprentissage supervisé se pose naturellement. Dans cet article, cette question est explorée sous 3 aspects : (i) les données artificielles sont-elles un complément efficace ? (ii) peuvent-elles remplacer les données d’origines quand ces dernières ne peuvent pas être distribuées, par exemple pour des raisons de confidentialité ? (iii) peuvent-elles améliorer l’explicabilité des classifieurs ? Différentes expériences sont menées sur une tâche de classification en utilisant des données générées artificiellement en adaptant des modèles GPT-2. Les résultats montrent que les données artificielles ne sont pas encore suffisamment bonnes et nécessitent un pré-traitement pour améliorer significativement les performances. Nous montrons que les approches sac-de-mots bénéficient le plus de telles augmentations de données.
Code (0)
등록된 구현이 없습니다.
Similar Papers 제목 키워드 기반
Approche lexicale de la simplification automatique de textes m\'edicaux (Lexical approach for the automatic simplification of medical texts)
Notre travail traite de la simplification automatique de textes. Ce type d{'}application vise {\`a} rendre des contenus difficiles {\`a} comprendre plus lisibles. {\`A} partir de trois corpus comparables du domaine m{\'e…
Transformations syntaxiques entre niveaux de simplification dans le corpus Newsela (Syntactic transformations between simplification levels in the Newsela corpus)
La simplification de textes est une t{\^a}che complexe du traitement automatique des langues. Depuis quelques ann{\'e}es, des corpus parall{\`e}les de textes originaux et simplifi{\'e}s sont propos{\'e}s, permettant d{'}…
Adaptation par enrichissement terminologique en traduction automatique statistique fond\'ee sur la g\'en\'eration et le filtrage de bi-segments virtuels
Nous pr{\'e}sentons des travaux pr{\'e}liminaires sur une approche permettant d{'}ajouter des termes bilingues {\`a} un syst{\`e}me de Traduction Automatique Statistique (TAS) {\`a} base de segments. Les termes sont non …
Une chaîne de traitement pour prédire et appréhender la complexité des textes pour enfants d’un point de vue linguistique (A Processing Chain to Explain the Complexity of Texts for Children From a Linguistic and Psycho-linguistic Point of View)
Nos travaux abordent la question de la mesure de la complexité d’un texte vis-à-vis d’une cible de lecteurs, les enfants en âge de lire, au travers de la mise en place d’une chaîne de traitements. Cette chaîne vise à ext…
D\'etection de concepts et granularit\'e de l'annotation (Concept detection and annotation granularity )
Nous nous int{\'e}ressons ici {\`a} une t{\^a}che de d{\'e}tection de concepts dans des textes sans exigence particuli{\`e}re de passage par une phase de d{\'e}tection d{'}entit{\'e}s avec leurs fronti{\`e}res. Il s{'}ag…