@article{whydollavavisionlanguagemodelsreplyto, title = {Why do LLaVA Vision-Language Models Reply to Images in English?}, author = {Musashi Hinck and Carolin Holtermann and Matthew Lyle Olson and Florian Schneider and Sungduk Yu and Anahita Bhiwandiwalla and Anne Lauscher and ShaoYen Tseng and Vasudev Lal}, year = {2024}, eprint = {2407.02333}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2407.02333v1}, }