paper-with-me

Multimodal Machine Translation

3개 벤치마크 · 논문 117편 · 이 태스크의 논문 보기 →

Benchmarks

Multi30K

결과 30개

Most implemented

Attention Is All You Need

2017-06-12 · 구현 595개

Papers

ForMaT: Dataset for Visually-Grounded Multilingual PDF Translation

2026-05-15 · Michał Ciesiółka, Dawid Wiśniewski, Adrian Charkiewicz, Kamil Guttmann arxiv

We present ForMaT (Format-Preserving Multilingual Translation), a parallel corpus of 3,956 PDFs across 15 language pairs that preserves original layout metadata proposed for multimodal machine translation. To ensure stru…

Multimodal Machine Translation

VIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation

2026-05-03 · Jingheng Pan, Xintong Wang, Longyue Wang, Liang Ding 외 arxiv

Ambiguity resolution is a key challenge in multimodal machine translation (MMT), where models must genuinely leverage visual input to map an ambiguous expression to its intended meaning. Although prior work has proposed …

Multimodal Machine Translation

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

2026-02-25 · Yexing Du, Youcheng Pan, Zekun Wang, Zheng Chu 외 arxiv

Multimodal Large Language Models (MLLMs) have achieved notable success in enhancing translation performance by integrating multimodal information. However, existing research primarily focuses on image-guided methods, who…

Multimodal Machine Translation

MultiScript30k: Leveraging Multilingual Embeddings to Extend Cross Script Parallel Data

2025-12-11 · Christopher Driggers-Ellis, Detravious Brinkley, Ray Chen, Aashish Dhawan 외 arxiv

Multi30k is frequently cited in the multimodal machine translation (MMT) literature, offering parallel text data for training and fine-tuning deep learning models. However, it is limited to four languages: Czech, English…

Multimodal Machine Translation

A Picture is Worth a Thousand (Correct) Captions: A Vision-Guided Judge-Corrector System for Multimodal Machine Translation

2025-11-10 · Siddharth Betala, Kushan Raj, Vipul Betala, Rohan Saswade arxiv

In this paper, we describe our system under the team name BLEU Monday for the English-to-Indic Multimodal Translation Task at WAT 2025. We participate in the text-only translation tasks for English-Hindi, English-Bengali…

Multimodal Machine Translation

IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs

2025-11-06 · Ali Faraz, Akash, Shaharukh Khan, Raja Kolla 외 arxiv

Vision-language models (VLMs) have demonstrated impressive generalization across multimodal tasks, yet most evaluation benchmarks remain Western-centric, leaving open questions about their performance in culturally diver…

Multimodal Machine TranslationVisual Question Answering

전체 117편 보기 →