@misc{indiciaecfba40e04808, title = {U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding}, author = {Ziqian Wang and Xianjun Xia and Xinfa Zhu and Lei Xie}, year = {2025}, url = {https://arxiv.org/abs/2505.13880}, note = {Source identifier: 2505.13880} }