@misc{indiciae844d67f25fab, title = {Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction}, author = {Ailin Huang and Boyong Wu and Bruce Wang and Chao Yan and Chen Hu and Chengli Feng and Fei Tian and Feiyu Shen and Jingbei Li and Mingrui Chen and Peng Liu and Ruihang Miao and Wang You and Xi Chen and Xuerui Yang and Yechang Huang and Yuxiang Zhang and Zheng Gong and Zixin Zhang and Hongyu Zhou and Jianjian Sun and Brian Li and Chengting Feng and Changyi Wan and Hanpeng Hu and Jianchang Wu and Jiangjie Zhen and Ranchen Ming and Song Yuan and Xuelin Zhang and Yu Zhou and Bingxin Li and Buyun Ma and Hongyuan Wang and Kang An and Wei Ji and Wen Li and Xuan Wen and Xiangwen Kong and Yuankai Ma and Yuanwei Liang and Yun Mou and Bahtiyar Ahmidi and Bin Wang and Bo Li and Changxin Miao and Chen Xu and Chenrun Wang and Dapeng Shi and Deshan Sun and Dingyuan Hu and Dula Sai and Enle Liu and Guanzhe Huang and Gulin Yan and Heng Wang and Haonan Jia and Haoyang Zhang and Jiahao Gong and Junjing Guo and Jiashuai Liu and Jiahong Liu and Jie Feng and Jie Wu and Jiaoren Wu and Jie Yang and Jinguo Wang and Jingyang Zhang and Junzhe Lin and Kaixiang Li and Lei Xia and Li Zhou and Liang Zhao and Longlong Gu and Mei Chen and Menglin Wu and Ming Li and Mingxiao Li and Mingliang Li and Mingyao Liang and Na Wang and Nie Hao and Qiling Wu and Qinyuan Tan and Ran Sun and Shuai Shuai and Shaoliang Pang and Shiliang Yang and Shuli Gao and Shanshan Yuan and Siqi Liu and Shihong Deng and Shilei Jiang and Sitong Liu and Tiancheng Cao and Tianyu Wang and Wenjin Deng and Wuxun Xie and Weipeng Ming and Wenqing He}, year = {2025}, url = {https://arxiv.org/abs/2502.11946}, note = {Source identifier: 2502.11946} }