@article{xr1towardsversatilevisionlanguageactionm, title = {XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations}, author = {Shichao Fan and Kun Wu and Zhengping Che and Xinhua Wang and Di Wu and Fei Liao and Ning Liu and Yixue Zhang and Zhen Zhao and Zhiyuan Xu and Meng Li and Qingjie Liu and Shanghang Zhang and Min Wan and Jian Tang}, year = {2025}, eprint = {2511.02776}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2511.02776}, }