@article{improvingvisionlanguageactionmodelfinetu, title = {Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision}, author = {Yuan Xu and Yixiang Chen and Kai Wang and Jiabing Yang and Peiyan Li and Qisen Ma and Yan Huang and Liang Wang}, year = {2026}, eprint = {2606.26801}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2606.26801}, }