@article{enhancingperceptioncapabilitiesof, title = {Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion}, author = {Zhuokun Chen and Jinwu Hu and Zeshuai Deng and Yufeng Wang and Bohan Zhuang and Mingkui Tan}, year = {2024}, eprint = {2412.01289}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2412.01289v2}, }