@article{mmfusermultimodalmultilayerfeaturefuser, title = {MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding}, author = {Yue Cao and Yangzhou Liu and Zhe Chen and Guangchen Shi and Wenhai Wang and Danhuai Zhao and Tong Lu}, year = {2024}, eprint = {2410.11829}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2410.11829v1}, }