@article{250608967, title = {Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model}, author = {Ailin Huang and Bingxin Li and Bruce Wang and Boyong Wu and Chao Yan and Chengli Feng and Heng Wang and HongYu Zhou and Hongyuan Wang and Jingbei Li and Jianjian Sun and Joanna Wang and Mingrui Chen and Peng Liu and Ruihang Miao and Shilei Jiang and Tian Fei and Wang You and Xi Chen and Xuerui Yang and Yechang Huang and Yuxiang Zhang and Zheng Ge and Zheng Gong and Zhewei Huang and Zixin Zhang and Bin Wang and Bo Li and Buyun Ma and Changxin Miao and Changyi Wan and Chen Xu and Dapeng Shi and Dingyuan Hu and Enle Liu and Guanzhe Huang and Gulin Yan and Hanpeng Hu and Haonan Jia and Jiahao Gong and Jiaoren Wu and Jie Wu and Jie Yang and Junzhe Lin and Kaixiang Li and Lei Xia and Longlong Gu and Ming Li and Nie Hao and Ranchen Ming and Shaoliang Pang and SiQi Liu and Song Yuan and Tiancheng Cao and Wen Li and Wenqing He and Xu Zhao and Xuelin Zhang and Yanbo Yu and Yinmin Zhong and Yu Zhou and Yuanwei Liang and Yuanwei Lu and Yuxiang Yang and Zidong Yang and Zili Zhang and Binxing Jiao and Heung-Yeung Shum and Jiansheng Chen and Jing Li and Xiangyu Zhang and Xinhao Zhang and Yibo Zhu and Daxin Jiang and Shuchang Zhou and Chen Hu}, year = {2025}, eprint = {2506.08967}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2506.08967v2}, }