paper-with-me

홈 › Papers

Generating Image Descriptions using Multilingual Data

2017-09-01 · WS 2017 9 · Alan Jaffe
📄 PDF Abstract BibTeX

Code (0)

등록된 구현이 없습니다.

Tasks

Image CaptioningLanguage ModelingLanguage ModellingMachine TranslationMultimodal Machine Translation

Similar Papers 제목 키워드 기반

On generating coherent multilingual descriptions of museum objects from Semantic Web ontologies

2012-05-01 · WS 2012 5 · Dana Dann{\'e}lls
Text Generation

Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models

2025-01-13 · Yongyu Mu, Hengyu Li, junxin Wang, Xiaoxuan Zhou 외

Previous work on augmenting large multimodal models (LMMs) for text-to-image (T2I) generation has focused on enriching the input space of in-context learning (ICL). This includes providing a few demonstrations and optimi…

Image GenerationIn-Context LearningRerankingText to Image Generation+1

Multi30K: Multilingual English-German Image Descriptions

2016-05-02 · WS 2016 8 · Desmond Elliott, Stella Frank, Khalil Sima'an, Lucia Specia

We introduce the Multi30K dataset to stimulate multilingual multimodal research. Recent advances in image description have been demonstrated on English-language datasets almost exclusively, but image description should n…

Image DescriptionMachine TranslationMultimodal Machine TranslationTranslation

Image Pivoting for Learning Multilingual Multimodal Representations

2017-07-24 · EMNLP 2017 9 · Spandana Gella, Rico Sennrich, Frank Keller, Mirella Lapata

In this paper we propose a model to learn multimodal multilingual representations for matching images and sentences in different languages, with the aim of advancing multilingual versions of image search and image unders…

Image DescriptionImage RetrievalSemantic Textual Similarity

Less is More: Generating Grounded Navigation Instructions from Landmarks

2021-11-25 · CVPR 2022 1 · Su Wang, Ceslee Montgomery, Jordi Orbay, Vighnesh Birodkar 외

We study the automatic generation of navigation instructions from 360-degree images captured on indoor routes. Existing generators suffer from poor visual grounding, causing them to rely on language priors and hallucinat…

DecoderInstruction FollowingVisual Grounding