@article{audiovisualintelligenceinlargefoundation, title = {Audio-Visual Intelligence in Large Foundation Models}, author = {You Qin and Kai Liu and Shengqiong Wu and Kai Wang and Shijian Deng and Yapeng Tian and Junbin Xiao and Yazhou Xing and Yinghao Ma and Bobo Li and Roger Zimmermann and Lei Cui and Furu Wei and Jiebo Luo and Hao Fei}, year = {2026}, eprint = {2605.04045}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.04045}, }