@article{250510917, title = {VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization}, author = {Mingxiao Li and Na Su and Fang Qu and Zhizhou Zhong and Ziyang Chen and Yuan Li and Zhaopeng Tu and Xiaolong Li}, year = {2025}, eprint = {2505.10917}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2505.10917v2}, }