@misc{indiciaeb1cea02b90e9, title = {Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts}, author = {Shun Lei and Yixuan Zhou and Liyang Chen and Dan Luo and Zhiyong Wu and Xixin Wu and Shiyin Kang and Tao Jiang and Yahui Zhou and Yuxing Han and Helen Meng}, year = {2024}, url = {https://arxiv.org/abs/2309.11977}, note = {Source identifier: 2309.11977} }