@article{vegavisualencodergroundingalignmentforsp, title = {VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models}, author = {Hao Wang and Xiaobao Wei and Jingyang He and Chengyu Bai and Chun-Kai Fan and Jiajun Cao and Jintao Chen and Ying Li and Shanyu Rong and Ming Lu and Xiaozhu Ju and Jian Tang and Shanghang Zhang}, year = {2026}, eprint = {2605.10485}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.10485}, }