@article{motionvlavisionlanguageactionmodelforhum, title = {MotionVLA: Vision-Language-Action Model for Humanoid Motion}, author = {Nonghai Zhang and Siyu Zhai and Yanjun Li and Zeyu Zhang and Zhihan Yin and Yandong Guo and Boxin Shi and Hao Tang}, year = {2026}, eprint = {2606.15142}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2606.15142}, }