Multilingual Training of Crosslingual Word Embeddings
Crosslingual word embeddings represent lexical items from different languages using the same vector space, enabling crosslingual transfer. Most prior work constructs embeddings for a pair of languages, with English on one side. We investigate methods for building high quality crosslingual word embeddings for many languages in a unified vector space.In this way, we can exploit and combine strength of many languages. We obtained high performance on bilingual lexicon induction, monolingual similarity and crosslingual document classification tasks.
Code (0)
등록된 구현이 없습니다.
Tasks
Bilingual Lexicon InductionDependency ParsingDocument ClassificationGeneral ClassificationMachine TranslationMultilingual Word EmbeddingsNamed Entity Recognition (NER)Sentiment AnalysisTransfer LearningWord EmbeddingsSimilar Papers 제목 키워드 기반
Beyond Bilingual: Multi-sense Word Embeddings using Multilingual Context
Word embeddings, which represent a word as a point in a vector space, have become ubiquitous to several NLP tasks. A recent line of work uses bilingual (two languages) corpora to learn a different vector for each sense o…
Representation LearningWord EmbeddingsCrosslingual Document Embedding as Reduced-Rank Ridge Regression
There has recently been much interest in extending vector-based word representations to multiple languages, such that words can be compared across languages. In this paper, we shift the focus from words to documents and …
Document EmbeddingregressionRetrievalSentenceLearning Multilingual Word Embeddings Using Image-Text Data
There has been significant interest recently in learning multilingual word embeddings -- in which semantically similar words across languages have similar embeddings. State-of-the-art approaches have relied on expensive …
Multilingual Word EmbeddingsSemantic SimilaritySemantic Textual SimilarityWord EmbeddingsMulti-SimLex: A Large-Scale Evaluation of Multilingual and Crosslingual Lexical Semantic Similarity
We introduce Multi-SimLex, a large-scale lexical resource and evaluation benchmark covering data sets for 12 typologically diverse languages, including major languages (e.g., Mandarin Chinese, Spanish, Russian) as well a…
Representation LearningSemantic SimilaritySemantic Textual SimilarityWord EmbeddingsOFA: A Framework of Initializing Unseen Subword Embeddings for Efficient Large-scale Multilingual Continued Pretraining
Instead of pretraining multilingual language models from scratch, a more efficient method is to adapt existing pretrained language models (PLMs) to new languages via vocabulary extension and continued pretraining. Howeve…
Language ModellingMultilingual Word EmbeddingsWord Embeddings