@article{audioenhancedvisionlanguagemodelingwith, title = {Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion}, author = {Yu Sun and Yin Li and Ruixiao Sun and Chunhui Liu and Fangming Zhou and Ze Jin and Linjie Wang and Xiang Shen and Zhuolin Hao and Hongyu Xiong}, year = {2025}, eprint = {2503.17551}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2503.17551v1}, }