@misc{indiciae0978403223a2, title = {SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models}, author = {Han Yin and Yafeng Chen and Chong Deng and Luyao Cheng and Hui Wang and Chao-Hong Tan and Qian Chen and Wen Wang and Xiangang Li}, year = {2026}, url = {https://arxiv.org/abs/2508.06372}, note = {Source identifier: 2508.06372} }