@article{vlm3rvisionlanguagemodelsaugmentedwith, title = {VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction}, author = {Zhiwen Fan and Jian Zhang and Renjie Li and Junge Zhang and Runjin Chen and Hezhen Hu and Kevin Wang and Huaizhi Qu and Dilin Wang and Zhicheng Yan and Hongyu Xu and Justin Theiss and Tianlong Chen and Jiachen Li and Zhengzhong Tu and Zhangyang Wang and Rakesh Ranjan}, year = {2025}, eprint = {2505.20279}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2505.20279v1}, }