TY - RPRT TI - ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer AU - Huadai Liu AU - Rongjie Huang AU - Xuan Lin AU - Wenqiang Xu AU - Maozong Zheng AU - Hong Chen AU - Jinzheng He AU - Zhou Zhao PY - 2024 UR - https://arxiv.org/abs/2305.12708 ID - 2305.12708 ER -