@article{towardsvisualtextgroundingofmultimodal, title = {Towards Visual Text Grounding of Multimodal Large Language Model}, author = {Ming Li and Ruiyi Zhang and Jian Chen and Jiuxiang Gu and Yufan Zhou and Franck Dernoncourt and Wanrong Zhu and Tianyi Zhou and Tong Sun}, year = {2025}, eprint = {2504.04974}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2504.04974v1}, }