@article{see2thinkdomultimodalmodelsreallyuseinte, title = {See2Think: Do Multimodal Models Really Use Intermediate Visual States?}, author = {Siyu Yan and Zhuoran Yan and Haiying Xu and Panhao Zhou and Jingyu Chen and Chenhao Ji and Shuo Cao and Yongheng Zhang and Haoze Liu and Siyu Zhang and Xiwen Gu and Yihao Liu and Alex Jinpeng Wang}, year = {2026}, eprint = {2607.26769}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2607.26769}, }