@article{visraavideobasedspatialreasoningagentfor, title = {ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models}, author = {Tingshu Mou and Jiabo He and Renying Wang and Ce Liu and Hao Yang and Tiehua Zhang and Jingjing Chen and Xingjun Ma}, year = {2026}, eprint = {2605.10106}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.10106}, }