paper-with-me

Papers

Vision Language Models Cannot Reason About Physical Transformation

2026-03-07 · Dezhi Luo, Yijiang Li, Maijunxian Wang, Tianwei Zhao, Bingyang Wang, Siheng Wang, Pinyuan Feng, Pooyan Rahmanzadehgervi, Ziqiao Ma, Hokin Deng arxiv

Understanding physical transformations is fundamental for reasoning in dynamic environments. While Vision Language Models (VLMs) show promise in embodied applications, whether they genuinely understand physical transformations remains unclear. We introduce ConservationBench evaluating conservation -- whether physical quantities remain invariant under transformations. Spanning four properties with paired conserving/non-conserving scenarios, we generate and evaluate 23,040 questions across 112 VLMs. Results reveal systematic failure: performance remains near chance with improvements on conservation tasks accompanied by drops on controls. Control experiments show strong textual priors favoring invariance, yet models perform worse with actual visual content when performance is balanced across conserving and non-conserving scenarios. Neither temporal resolution, prompting, nor curated sampling helps. These findings show that current VLMs fail to maintain transformation-invariant representations of physical properties across dynamic scenes.

📄 PDF Abstract BibTeX arXiv:2603.07109

Code (0)

등록된 구현이 없습니다.

Similar Papers 제목 키워드 기반

ESPRIT: Explaining Solutions to Physical Reasoning Tasks

2020-05-02 · ACL 2020 6 · Nazneen Fatema Rajani, Rui Zhang, Yi Chern Tan, Stephan Zheng 외

Neural networks lack the ability to reason about qualitative physics and so cannot generalize to scenarios and tasks unseen during training. We propose ESPRIT, a framework for commonsense reasoning about qualitative phys…

Physically Grounded Vision-Language Models for Robotic Manipulation

2023-09-05 · Jensen Gao, Bidipta Sarkar, Fei Xia, Ted Xiao 외

Recent advances in vision-language models (VLMs) have led to improved performance on tasks such as visual question answering and image captioning. Consequently, these models are now well-positioned to reason about the ph…

Image CaptioningLanguage ModellingLarge Language ModelObject+2

From Perception to Action: An Interactive Benchmark for Vision Reasoning

2026-02-24 · Yuhao Wu, Maojia Song, Yihuai Lan, Lei Wang 외 arxiv

Understanding the physical structure is essential for real-world applications such as embodied agents, interactive design, and long-horizon manipulation. Yet, prevailing Vision-Language Model (VLM) evaluations still cent…

Physical Property Understanding from Language-Embedded Feature Fields

2024-04-05 · CVPR 2024 1 · Albert J. Zhai, Yuan Shen, Emily Y. Chen, Gloria X. Wang 외

Can computers perceive the physical properties of objects solely through vision? Research in cognitive science and vision science has shown that humans excel at identifying materials and estimating their physical propert…

Friction

PhysMem: Scaling Test-Time Memory for Embodied Physical Reasoning

2026-02-23 · Haoyang Li, Yang You, Hao Su, Leonidas Guibas arxiv

Reliable object manipulation requires understanding physical properties that vary across objects and environments. Vision-language model (VLM) planners can reason about friction and stability in general terms; however, t…