@misc{indiciae4cd21c41710a, title = {VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers}, author = {Sanyuan Chen and Shujie Liu and Long Zhou and Yanqing Liu and Xu Tan and Jinyu Li and Sheng Zhao and Yao Qian and Furu Wei}, year = {2024}, url = {https://arxiv.org/abs/2406.05370}, note = {Source identifier: 2406.05370} }