@article{visionlanguagemodelslaghumanperformanceo, title = {Vision-language models lag human performance on physical dynamics and intent reasoning}, author = {Tianjun Gu and Jingyu Gong and Zhizhong Zhang and Yuan Xie and Lizhuang Ma and Xin Tan and Athanasios V}, year = {2026}, eprint = {2601.01547}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2601.01547}, }