@article{gemvgtowardsgeneralizedmultiimagevisualg, title = {GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models}, author = {Shurong Zheng and Yousong Zhu and Hongyin Zhao and Fan Yang and Yufei Zhan and Ming Tang and Jinqiao Wang}, year = {2026}, eprint = {2601.04777}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2601.04777}, }