@article{vitaaudiofastinterleavedcrossmodaltoken, title = {VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model}, author = {Zuwei Long and Yunhang Shen and Chaoyou Fu and Heting Gao and Lijiang Li and Peixian Chen and Mengdan Zhang and Hang Shao and Jian Li and Jinlong Peng and Haoyu Cao and Ke Li and Rongrong Ji and Xing Sun}, year = {2025}, eprint = {2505.03739}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2505.03739v1}, }