@article{st4vlaspatiallyguidedtrainingforvisionla, title = {ST4VLA: Spatially Guided Training for Vision-Language-Action Models}, author = {Jinhui Ye and Fangjing Wang and Ning Gao and Junqiu Yu and Yangkun Zhu and Bin Wang and Jinyu Zhang and Weiyang Jin and Yanwei Fu and Feng Zheng and Yilun Chen and Jiangmiao Pang}, year = {2026}, eprint = {2602.10109}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2602.10109}, }