French CrowS-Pairs: Extension à une langue autre que l’anglais d’un corpus de mesure des biais sociétaux dans les modèles de langue masqués (French CrowS-Pairs : Extending a challenge dataset for measuring social bias in masked language models to a language other than English)
Afin de permettre l’étude des biais en traitement automatique de la langue au delà de l’anglais américain, nous enrichissons le corpus américain CrowS-pairs de 1 677 paires de phrases en français représentant des stéréotypes portant sur dix catégories telles que le genre. 1 467 paires de phrases sont traduites à partir de CrowS-pairs et 210 sont nouvellement recueillies puis traduites en anglais. Selon le principe des paires minimales, les phrases du corpus contrastent un énoncé stéréotypé concernant un groupe défavorisé et son équivalent pour un groupe favorisé. Nous montrons que quatre modèles de langue favorisent les énoncés qui expriment des stéréotypes dans la plupart des catégories. Nous décrivons le processus de traduction et formulons des recommandations pour étendre le corpus à d’autres langues. Attention : Cet article contient des énoncés de stéréotypes qui peuvent être choquants.
Code (0)
등록된 구현이 없습니다.
Similar Papers 제목 키워드 기반
Vers la traduction automatique d'adverbiaux temporels du fran\ccais vers la langue des signes fran\ccaise (Towards the automatic translation of temporal adverbials from French to French sign language)
Nous pr{\'e}sentons ici de premiers travaux abordant la question de r{\`e}gles de passage entre deux formalismes d{\'e}crivant la s{\'e}mantique d{'}adverbiaux temporels respectivement pour le fran{\c{c}}ais et pour la L…
French CrowS-Pairs: Extending a challenge dataset for measuring social bias in masked language models to a language other than English
Warning: This paper contains explicit statements of offensive stereotypes which may be upsetting.Much work on biases in natural language processing has addressed biases linked to the social and cultural experience of Eng…
SentenceDutch CrowS-Pairs: Adapting a Challenge Dataset for Measuring Social Biases in Language Models for Dutch
Warning: This paper contains explicit statements of offensive stereotypes which might be upsetting. Language models are prone to exhibiting biases, further amplifying unfair and harmful stereotypes. Given the fast-growin…
Estimer la notori\'et\'e d'un nom propre via Wikipedia (Estimate the notoriety of a Proper name using Wikipedia)
Cet article propose de calculer, via Wikipedia, un indice de notori{\'e}t{\'e} pour les entr{\'e}es du dictionnaire relationnel multilingue de noms propres Prolexbase. Cet indice de notori{\'e}t{\'e} d{\'e}pend de la lan…
Utilisation des r\'eseaux de neurones r\'ecurrents pour la projection interlingue d'\'etiquettes morpho-syntaxiques \`a partir d'un corpus parall\`ele
La construction d{'}outils d{'}analyse linguistique pour les langues faiblement dot{\'e}es est limit{\'e}e, entre autres, par le manque de corpus annot{\'e}s. Dans cet article, nous proposons une m{\'e}thode pour constru…