Multimodal Machine Translation
3개 벤치마크 · 논문 117편 · 이 태스크의 논문 보기 →
Benchmarks
Most implemented
Attention Is All You Need
Towards Zero-Shot Multimodal Machine Translation
Tackling Ambiguity with Images: Improved Multimodal Machine Translation and Contrastive Evaluation
On Vision Features in Multimodal Machine Translation
Multi30K: Multilingual English-German Image Descriptions
3AM: An Ambiguity-Aware Multi-Modal Machine Translation Dataset
Papers
ForMaT: Dataset for Visually-Grounded Multilingual PDF Translation
We present ForMaT (Format-Preserving Multilingual Translation), a parallel corpus of 3,956 PDFs across 15 language pairs that preserves original layout metadata proposed for multimodal machine translation. To ensure stru…
Multimodal Machine TranslationVIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation
Ambiguity resolution is a key challenge in multimodal machine translation (MMT), where models must genuinely leverage visual input to map an ambiguous expression to its intended meaning. Although prior work has proposed …
Multimodal Machine TranslationScalable Multilingual Multimodal Machine Translation with Speech-Text Fusion
Multimodal Large Language Models (MLLMs) have achieved notable success in enhancing translation performance by integrating multimodal information. However, existing research primarily focuses on image-guided methods, who…
Multimodal Machine TranslationMultiScript30k: Leveraging Multilingual Embeddings to Extend Cross Script Parallel Data
Multi30k is frequently cited in the multimodal machine translation (MMT) literature, offering parallel text data for training and fine-tuning deep learning models. However, it is limited to four languages: Czech, English…
Multimodal Machine TranslationA Picture is Worth a Thousand (Correct) Captions: A Vision-Guided Judge-Corrector System for Multimodal Machine Translation
In this paper, we describe our system under the team name BLEU Monday for the English-to-Indic Multimodal Translation Task at WAT 2025. We participate in the text-only translation tasks for English-Hindi, English-Bengali…
Multimodal Machine TranslationIndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs
Vision-language models (VLMs) have demonstrated impressive generalization across multimodal tasks, yet most evaluation benchmarks remain Western-centric, leaving open questions about their performance in culturally diver…
Multimodal Machine TranslationVisual Question Answering