@article{svllstagedvisionlanguagelearningforphysi, title = {SVLL: Staged Vision-Language Learning for Physically Grounded Embodied Task Planning}, author = {Yuyuan Yang and Junkun Hong and Hongrong Wang and Honghao Cai and Xunpeng Ren and Ge Wang and Mingcong Lei and Shenhao Yan and Jiahao Yang and Chengsi Yao and Xi Li and Yiming Zhao and Yatong Han and Jinke Ren}, year = {2026}, eprint = {2603.11563}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2603.11563}, }