paper-with-me

Papers

Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs

2026-05-23 · Wen Ma, Fucheng Niu, Zhiting Fan, Zikai Xiao, Jiaxiang Liu, Zuozhu Liu arxiv

Vision-language models have demonstrated impressive capabilities in general medical visual question answering, yet due to limited interpretability, it remains unclear whether their predictions reflect evidence-grounded clinical reasoning or reliance on spurious priors. We introduce Med-R2 Bench, a hierarchical benchmark aligned with the clinical workflow to evaluate adversarial robustness with visual grounding. We design stepwise QA tasks to assess whether reasoning chains are strictly grounded in visual evidence across the four clinical stages, and employ adversarial perturbations to test robustness against misleading cues. Med-R2 comprises 42,432 images, 31 task categories, and 110,406 QA pairs. Evaluation across 14 VLMs reveals a sequential performance degradation along the four-stage clinical workflow. Adversarial experiments show that models rely heavily on correct prompts to guess answers. Even when provided with explicit visual cues, the models struggle to accurately align textual descriptions. Finally, we demonstrate stepwise fine-tuning using our hierarchical data significantly improves reasoning robustness, highlighting its potential to drive future improvements in evidence-based medical AI.

📄 PDF Abstract BibTeX arXiv:2605.24492

Code (0)

등록된 구현이 없습니다.

Tasks

Visual Question AnsweringAdversarial RobustnessVisual Grounding

Similar Papers 제목 키워드 기반

CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework

2026-03-02 · Yuexi Du, Jinglu Wang, Shujie Liu, Nicha C. Dvornek 외 arxiv

Large visual language models (VLMs) have shown strong multi-modal medical reasoning ability, but most operate as end-to-end black boxes, diverging from clinicians' evidence-based, staged workflows and hindering clinical …

Reinforcement LearningVisual Grounding

Weaving Multi-Source Evidence for Biomedical Reasoning: The BioMedHop Benchmark and BioWeave Framework

2026-06-15 · Xingyu Tan, Shiyuan Liu, Xiaoyang Wang, Qing Liu 외 arxiv

Biomedical question answering (QA) increasingly requires reasoning over interacting entities, where supporting evidence is scattered across biomedical knowledge graphs, literature documents, and web-accessible resources.…

Question AnsweringKnowledge Graphs

UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA

2026-06-10 · Mengzhuo Chen, Yan Shu, Chi Liu, Hongming Piao 외 arxiv

We study whether grounded reasoning supervision from abundant 2D medical images can improve 3D medical VQA when both input types are aligned through a common reasoning interface. We introduce UniReason-Med, a single-chec…

Reinforcement Learning

FaithMed: Training LLMs For Faithful Evidence-Based Medical Reasoning

2026-07-01 · Zhiyun Zhang, Liwen Sun, Xiang Qian, Chenyan Xiong arxiv

Faithful reasoning is essential in medicine, where clinical decisions require transparent justification grounded in reliable evidence. Current medical LLMs either lack active access to evidence or use retrieved evidence …

Reinforcement Learning

Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models

2026-05-11 · Minh Khoi Nguyen, Dai Lam Le, Amir Reza Jafari, Tuan Dung Nguyen 외 arxiv

Large vision-language models (VLMs) demonstrate strong performance in medical image understanding, but frequently generate clinically plausible yet incorrect statements, raising significant safety concerns. Existing medi…