@article{vlmqlearningaligningvisionlanguage, title = {VLM Q-Learning: Aligning Vision-Language Models for Interactive Decision-Making}, author = {Jake Grigsby and Yuke Zhu and Michael Ryoo and Juan Carlos Niebles}, year = {2025}, eprint = {2505.03181}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2505.03181v1}, }