paper-with-me

홈 › Papers

Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages

2026-03-23 · Swastik R arxiv

Vision-language models score well on mathematical, scientific, and spatial reasoning benchmarks, yet these evaluations are overwhelmingly English. I present the first cross-lingual visual reasoning audit for Indian languages. 980 questions from MathVista, ScienceQA, and MMMU are translated into Hindi, Tamil, Telugu, Bengali, Kannada, and Marathi using IndicTrans2, with Gemini 2.0 Flash cross-verification on 50 samples per language (inter-translator agreement 0.79-0.84). Eight VLMs, from 7B open-source models to GPT-4o, are evaluated across all seven languages, yielding 68,600 inference records that include text-only and chain-of-thought ablations. I find accuracy drops of 9.8-25 percentage points when switching from English to an Indian language, with Dravidian languages suffering up to 13.2 pp more than Indo-Aryan. Chain-of-thought prompting degrades Bengali (-14.4 pp) and Kannada (-11.4 pp) rather than helping, exposing English-centric reasoning chains. Aya-Vision-8B, built for 23 languages, still drops 28.5 pp on Dravidian scripts; multilingual pretraining alone does not transfer visual reasoning. I release the translated benchmark and all model outputs.

📄 PDF Abstract BibTeX arXiv:2603.26742

Code (0)

등록된 구현이 없습니다.

Tasks

Spatial ReasoningVisual Reasoning

Similar Papers 제목 키워드 기반

Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering

2025-11-28 · Qiming Li, Xiaocheng Feng, Yixuan Ma, Zekai Ye 외 arxiv

Large Language Models (LLMs) and Large Vision-Language Models (LVLMs) demonstrate strong reasoning capabilities, yet their performance in English significantly outperforms that in low-resource languages, raising fairness…

Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models

2025-08-25 · Yuchun Fan, Yilin Wang, Yongyu Mu, Lei Huang 외 arxiv

Large vision-language models (LVLMs) have demonstrated exceptional capabilities in understanding visual information with human languages but also exhibit an imbalance in multilingual capabilities. In this work, we delve …

Visual Reasoning

Are Pretrained Multilingual Models Equally Fair Across Languages?

2022-10-11 · COLING 2022 10 · Laura Cabello Piqueras, Anders Søgaard

Pretrained multilingual language models can help bridge the digital language divide, enabling high-quality NLP models for lower resourced languages. Studies of multilingual models have so far focused on performance, cons…

Cloze TestFairnessPretrained Multilingual Language ModelsXLM-R

Are Pretrained Multilingual Models Equally Fair Across Languages?

2022-01-16 · ACL ARR January 2022 1 · Anonymous

Pretrained multilingual language models can help bridge the digital language divide, enabling high-quality NLP models for lower-resourced languages. Studies of multilingual models have so far focused on performance, cons…

Cloze TestFairnessPretrained Multilingual Language ModelsXLM-R

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

2026-06-15 · Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina, Rajvee Sheth arxiv

Current multilingual evaluations for Vision-Language Models (VLMs) assume a one-to-one mapping between language and orthography, overlooking billions of users of multi-script languages. We introduce PuMVR (Punjabi Multim…

Visual Reasoning