@misc{indiciae985073c1c25d, title = {HAM-TTS: Hierarchical Acoustic Modeling for Token-Based Zero-Shot Text-to-Speech with Model and Data Scaling}, author = {Chunhui Wang and Chang Zeng and Bowen Zhang and Ziyang Ma and Yefan Zhu and Zifeng Cai and Jian Zhao and Zhonglin Jiang and Yong Chen}, year = {2024}, url = {https://arxiv.org/abs/2403.05989}, note = {Source identifier: 2403.05989} }