paper-with-me

Papers

Reinforcing Multimodal Reasoning Against Visual Degradation

2026-05-10 · Rui Liu, Dian Yu, Haolin Liu, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang arxiv

Reinforcement Learning has significantly advanced the reasoning capabilities of Multimodal Large Language Models (MLLMs), yet the resulting policies remain brittle against real-world visual degradations such as blur, compression artifacts, and low-resolution scans. Prior robustness techniques from vision and deep RL rely on static data augmentation or value-based regularization, neither of which transfers cleanly to critic-free RL fine-tuning of autoregressive MLLMs. Reinforcing reasoning against such corruptions is non-trivial: naively injecting degraded views during rollout induces reward poisoning, where perceptual occlusions trigger hallucinated trajectories and destabilize optimization. We propose ROMA, an RL fine-tuning framework that modifies the optimization dynamics to reinforce reasoning against visual degradation while preserving clean-input performance. A dual-forward-pass strategy uses teacher forcing to evaluate corrupted views against clean-image trajectories, avoiding new rollouts on degraded inputs. For distributional consistency, we apply a token-level surrogate KL penalty against the worst-case augmentation; to prevent policy collapse under regularization, an auxiliary policy gradient loss anchored to clean-image advantages preserves a reliable reward signal; and to avoid systematically incorrect invariance, correctness-conditioned regularization restricts enforcement to successful trajectories. On Qwen3-VL 4B/8B across seven multimodal reasoning benchmarks, our method improves robustness by +2.4% on seen and +2.3% on unseen corruptions over GRPO while matching clean accuracy.

📄 PDF Abstract BibTeX arXiv:2605.09262

Code (0)

등록된 구현이 없습니다.

Tasks

Reinforcement LearningMultimodal ReasoningData Augmentation

Similar Papers 제목 키워드 기반

Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention

2026-05-21 · Changyuan Tian, Zhicong Lu, Huaxing Liu, Xiang Wang 외 arxiv

Reinforcement learning with verifiable rewards (RLVR) has emerged as a promising paradigm for advancing complex reasoning in large language models, and recent work extends RLVR to multimodal large language models (MLLMs)…

Reinforcement LearningMultimodal Reasoning

Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models

2026-03-21 · Enguang Wang, Qiang Wang, Yuanchen Wu, Ke Yan 외 arxiv

While Multimodal Large Language Models (MLLMs) excel at vision-language tasks, the cost of their language-driven training on internal visual foundational competence remains unclear. In this paper, we conduct a detailed d…

Answer Generation

Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs

2026-02-09 · Siqu Ou, Tianrui Wan, Zhiyuan Zhao, Junyu Gao 외 arxiv

While chain-of-thought (CoT) reasoning has substantially improved multimodal large language models (MLLMs) on complex reasoning tasks, existing approaches largely rely on long textual reasoning trajectories and provide l…

Reinforcement LearningVisual Reasoning

Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination

2025-11-21 · Yolo Y. Tang, Daiki Shimada, Hang Hua, Chao Huang 외 arxiv

Understanding text-rich videos requires reading small, transient textual cues that often demand repeated inspection. Yet most video QA models rely on single-pass perception over fixed frames, leading to hallucinations an…

Reinforcement LearningMultimodal Reasoning

ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning

2025-07-22 · Chi-Pin Huang, Yueh-Hua Wu, Min-Hung Chen, Yu-Chiang Frank Wang 외 arxiv

Vision-language-action (VLA) reasoning tasks require agents to interpret multimodal instructions, perform long-horizon planning, and act adaptively in dynamic environments. Existing approaches typically train VLA models …

Robot Manipulation