@misc{indiciaea61bc9d029aa, title = {Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment}, author = {Jeongsoo Choi and Zhikang Niu and Ji-Hoon Kim and Chunhui Wang and Joon Son Chung and Xie Chen}, year = {2025}, url = {https://arxiv.org/abs/2505.19595}, note = {Source identifier: 2505.19595} }