@article{speakerlmendtoendversatilespeakerdiariza, title = {SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models}, author = {Han Yin and Yafeng Chen and Chong Deng and Luyao Cheng and Hui Wang and Chao-Hong Tan and Qian Chen and Wen Wang and Xiangang Li}, year = {2025}, eprint = {2508.06372}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2508.06372}, }