L'\'evaluation des repr\'esentations vectorielles de mots en utilisant WordNet (Evaluating word representations using WordNet)
Les m{\'e}thodes d{'}{\'e}valuation actuelles des repr{\'e}sentations vectorielles de mots utilisent g{\'e}n{\'e}ralement un jeu de donn{\'e}es restreint et biais{\'e}. Pour pallier {\a} ce probl{\e}me nous pr{\'e}sentons une nouvelle approche, bas{\'e}e sur la similarit{\'e} entre les synsets associ{\'e}s aux mots dans la volumineuse base de donn{\'e}es lexicale WordNet. Notre m{\'e}thode d{'}{\'e}valuation consiste dans un premier temps {\a} classer automatiquement les repr{\'e}sentions vectorielles de mots {\a} l{'}aide d{'}un algorithme de clustering, puis {\a} {\'e}valuer la coh{\'e}rence s{\'e}mantique et syntaxique des clusters produits. Cette {\'e}valuation est effectu{\'e}e en calculant la similarit{\'e} entre les mots de chaque cluster, pris deux {\a} deux, en utilisant des mesures de similarit{\'e} entre les mots dans WordNet propos{\'e}es par NLTK (wup {\_}similarity). Nous obtenons, pour chaque cluster, une valeur entre 0 et 1. Un cluster dont la valeur est 1 est un cluster dont tous les mots appartiennent au m{\^e}me synset. Nous calculons ensuite la moyenne des mesures de tous les clusters. Nous avons utilis{\'e} notre nouvelle approche pour {\'e}tudier et comparer trois m{\'e}thodes de repr{\'e}sentations vectorielles : une m{\'e}thode traditionnelle, WebSOM et deux m{\'e}thodes r{\'e}centes, word2vec (Skip-Gram et CBOW) et GloVe, sur trois corpus : en anglais, en fran{\c{c}}ais et en arabe.
Code (0)
등록된 구현이 없습니다.
Tasks
ClusteringSimilar Papers 제목 키워드 기반
Apport de l'information temporelle des contextes pour la repr\'esentation vectorielle continue des mots
Les repr{\'e}sentations vectorielles continues des mots sont en plein essor et ont d{\'e}j{\`a} {\'e}t{\'e} appliqu{\'e}es avec succ{\`e}s {\`a} de nombreuses t{\^a}ches en traitement automatique de la langue (TAL). Dans…
es-enRepr\'esentation vectorielle de paires de verbes pour la pr\'ediction de relations lexicales (Verb-pairs embeddings for discourse relation prediction)
Dans cet article, nous proposons un mod{\`e}le de repr{\'e}sentations vectorielles de paire de mots, obtenues {\`a} partir d{'}une adaptation du mod{\`e}le Skip-gram de Word2vec. Ce mod{\`e}le est utilis{\'e} pour g{\'e}…
Relation PredictionUne approche hybride pour la construction de lexiques bilingues d'expressions multi-mots \`a partir de corpus parall\`eles (A hybrid approach to build bilingual lexicons of multiword expressions from parallel corpora)
Les expressions multi-mots jouent un r{\^o}le important dans diff{\'e}rentes applications du Traitement Automatique de la Langue telles que la traduction automatique et la recherche d{'}information interlingue. Cet artic…
Transport Optimal pour le Changement Sémantique à partir de Plongements Contextualisés (Optimal Transport for Semantic Change Detection using Contextualised Embeddings )
Plusieurs méthodes de détection des changements sémantiques utilisant des plongements lexicaux contextualisés sont apparues récemment. Elles permettent une analyse fine du changement d’usage des mots, en agrégeant les pl…
Change DetectionIdentification de profil clinique du patient: Une approche de classification de séquences utilisant des modèles de langage français contextualisés (Identification of patient clinical profiles : A sequence classification approach using contextualised French language models )
Cet article présente un résumé de notre soumission pour Tâche 1 de DEFT 2021. Cette tâche consiste à identifier le profil clinique d’un patient à partir d’une description textuelle de son cas clinique en identifiant les …
Language Modelling