paper-with-me

Papers Visual Reasoning

“Visual Reasoning” 태그가 달린 논문 1,326편 · 필터 해제

Reason Through the Latent! Making Latent Visual Reasoning Necessary

2026-09-06 · Suhyeong Park, Junha Jung, Jaewoo Kang hf

Latent visual reasoning aims to perform multimodal reasoning through hidden-state computation rather than explicit textual chains of thought. However, visual information being present in a latent state does not imply tha…

Multimodal ReasoningVisual Reasoning

From Vision to Language: Investigating Causal Information Flow in Multimodal Decision-Making

2026-09-04 · Davide Testa, Hugh Mee Wong, Alessandro Lenci, Bernardo Magnini 외 arxiv

Vision-Language Models are commonly evaluated through their final predictions, but understanding whether these decisions are grounded in visual evidence requires tracing how visual information contributes to language-bas…

Visual Reasoning

PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

2026-08-27 · Junjie Liu, Shengyuan Ye, Xu Chen arxiv

Vision-Language Models (VLMs) demonstrate exceptional visual reasoning capabilities, yet their inference costs escalate rapidly with the proliferation of visual tokens. Existing visual token pruning methods exhibit two f…

Visual Reasoning

G2D: Generative-to-Discriminative Collaborative Inference for Zero-Shot Image Classification

2026-08-27 · Zehua Hao, Fang Liu, Qinliang Wang, Yaoyang Du 외 arxiv

Zero-shot classification needs efficient label retrieval and fine-grained visual reasoning, yet discriminative and generative vision-language models fail in complementary ways.When CLIP's top-1 prediction is wrong, the c…

Zero-Shot Image ClassificationVisual Reasoning

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

2026-08-26 · Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang 외 arxiv

Native visual reasoning treats visual generation as the medium of reasoning itself: visual states (i.e. images and videos) are not merely inputs to be understood or outputs to be rendered, but first-class substrates for …

Reinforcement LearningVideo GenerationVisual Reasoning

Investigating Relational Reasoning in VLMs

2026-08-24 · Adhithya Laxman Ravi Shankar Geetha, Aulia Kharis Rakhmasari, Haleema Ramzan, Xander Yap arxiv

Vision-Language Models (VLMs) achieve strong performance in visual reasoning tasks, but it remains unclear whether they understand visual relations, or simply employ shortcuts such as language cues or priors. To investig…

Relational ReasoningVisual Reasoning

VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences

2026-08-21 · Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor, Francisco Guzmán 외 arxiv

In professional life sciences workflows, scientists routinely interpret visual artifacts (gel blots, microscopy images, plasmid maps, flow cytometry plots, molecular structures, ...) to inform research decisions. We intr…

Visual Reasoning

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

2026-08-21 · Yantao Li, Huanlin Gao, Fang Zhao, Chao Tan 외 arxiv

Speculative decoding accelerates autoregressive generation by allowing a lightweight drafter to propose future tokens while a target model verifies them in parallel. Its lossless guarantee has motivated a line of work th…

Visual ReasoningImage Captioning

VGI-Bench: Probing Visual Intelligence in Video Generation Models

2026-08-20 · Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma 외 arxiv

Recent studies suggest that video generation models can exhibit certain forms of zero-shot visual reasoning through generated frames. Yet reliable evaluation remains challenging: benchmarks should adopt inputs aligned wi…

Visual ReasoningVideo Generation

When Safety Overrides Vision: Exploring Dynamics between Vision Influence and Safety Alignment in Vision-Language Models

2026-08-19 · Mehak Gupta, Tanmoy Chakraborty arxiv

Aligned vision-language models (VLMs) are designed to balance grounded visual reasoning with safe generation behavior. However, we observe a striking phenomenon: under safety-constrained instruction, models frequently ab…

Visual Reasoning

Continual Reasoning Gym: Diagnosing and Harnessing Shared Reasoning in Continual RLVR

2026-08-19 · Lirui Luo, Guoxi Zhang, Hongming Xu, Rongqing Li 외 arxiv

Reinforcement learning with verifiable rewards (RLVR) commonly post-trains reasoning models on multiple tasks, while rerunning multitask RLVR (MTRL) as new tasks are added makes capability expansion costly. We therefore …

Reinforcement LearningVisual Reasoning

PathoArgus: Advancing Evidence-Grounded Long-Context Visual Reasoning across Gigapixel Whole-Slide and Multi-Slide Case Contexts

2026-08-18 · Bowen Liu, Qixiang Zhang, Xiaomeng Li arxiv

Whole-slide pathology reasoning requires models to integrate gigapixel-scale visual evidence across complete case-linked slides, yet current question-answering benchmarks primarily measure final answer accuracy--a metric…

Visual Reasoning

REChart: Reasoning-Efficient Chart Editing with Large Reasoning Models

2026-08-18 · Yuanbang Liu, Chenxi Ruan, Yihan Hou, Qiong Luo 외 arxiv

Chart editing requires inferring and modifying visualization code from a reference chart image based on an editing instruction, challenging fine-grained visual reasoning, instruction following, and executable code synthe…

Reinforcement LearningInstruction FollowingVisual Reasoning

ChartProbe: A Diagnostic Study on Visual Reasoning through Perception, Grounding, and Simple Reasoning

2026-08-13 · Mahsa Khoshnoodi, Sarah Adel Bargal arxiv

Vision-language models (VLMs) remain unreliable on chart questions that require reasoning over visual quantities, and this weakness is usually attributed to a reasoning deficit and addressed with more reasoning supervisi…

Visual Reasoning

UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations

2026-08-11 · Dvir Samuel, Guy Bar-Shalom, Fabrizio Frasca, Ethan Fetaya 외 hf

Large Vision-Language Models (LVLMs) achieve impressive visual reasoning and dialogue capabilities, yet frequently hallucinate content unsupported by the visual input. Effective mitigation requires token-level localizati…

Visual Reasoning

VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use

2026-08-09 · Juan S. Santillana hf

We present VectraYX-Vision-1B, a sub-2B vision-language model (VLM) for Spanish/LATAM cybersecurity imagery, coupling a frozen SigLIP-so400m encoder to a 1.04B Spanish/LATAM security decoder via an MLP. To our knowledge,…

Visual Reasoning

Evidence-RL: Towards Evidence-intensive Visual Reasoning

2026-08-08 · Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen 외 hf

Vision-Language Models (VLMs) should answer from concrete image evidence rather than language priors, dataset shortcuts, or irrelevant visual context. Existing perception-aware post-training methods encourage image use t…

Visual Reasoning

OPD-V: Visual On-Policy Self-Distillation with Modality Balance

2026-08-05 · Aniri, Jinhe Bi, Peng Liao, Zengjie Jin 외 hf

On-Policy Self-Distillation (OPSD) has become a standard post-training approach for improving visual reasoning in multimodal large language models (MLLMs). Existing methods draw privileged information from diverse input …

Visual Reasoning

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

2026-08-04 · Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang arxiv

Post-training reinforcement learning (RL) algorithms are commonly used to align large vision-language models (LVLMs) with human intent and the requirements of visual reasoning tasks. However, existing RL-based alignment …

Reinforcement LearningMultimodal ReasoningVisual GroundingVisual Reasoning

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

2026-08-03 · Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang 외 hf

Chart question answering (CQA) requires multimodal large language models (MLLMs) to integrate visual comprehension with logical reasoning, yet current models struggle with accurate visual grounding and coherent reasoning…

Chart Question AnsweringMultimodal ReasoningLogical ReasoningVisual Reasoning
1–20 / 1,326 다음 →