@article{vlm4dtowardsspatiotemporalawarenessinvis, title = {VLM4D: Towards Spatiotemporal Awareness in Vision Language Models}, author = {Shijie Zhou and Alexander Vilesov and Xuehai He and Ziyu Wan and Shuwang Zhang and Aditya Nagachandra and Di Chang and Dongdong Chen and Xin Eric Wang and Achuta Kadambi}, year = {2025}, eprint = {2508.02095}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2508.02095}, }