@article{urbanvideobenchbenchmarkingvisionlanguag, title = {UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces}, author = {Baining Zhao and Jianjie Fang and Zichao Dai and Ziyou Wang and Jirong Zha and Weichen Zhang and Chen Gao and Yue Wang and Jinqiang Cui and Xinlei Chen and Yong Li}, year = {2025}, eprint = {2503.06157}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2503.06157v1}, }