@misc{indiciaeeb219f8c52a7, title = {Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers}, author = {Chengyi Wang and Sanyuan Chen and Yu Wu and Ziqiang Zhang and Long Zhou and Shujie Liu and Zhuo Chen and Yanqing Liu and Huaming Wang and Jinyu Li and Lei He and Sheng Zhao and Furu Wei}, year = {2023}, url = {https://arxiv.org/abs/2301.02111}, note = {Source identifier: 2301.02111} }