@article{m3vqaabenchmarkformultimodalmultientitym, title = {M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering}, author = {Jiatong Ma and Longteng Guo and Yuchen Liu and Zijia Zhao and Dongze Hao and Xuanxu Lin and Jing Liu}, year = {2026}, eprint = {2604.25122}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2604.25122}, }