@article{bridgingearsandeyesanalyzingaudioand, title = {Bridging Ears and Eyes: Analyzing Audio and Visual Large Language Models to Humans in Visible Sound Recognition and Reducing Their Sensory Gap via Cross-Modal Distillation}, author = {Xilin Jiang and Junkai Wu and Vishal Choudhari and Nima Mesgarani}, year = {2025}, eprint = {2505.06803}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2505.06803v1}, }