@misc{indiciae0a3f3ecba6b5, title = {M3-TTS: Multi-modal DiT Alignment \& Mel-latent for Zero-shot High-fidelity Speech Synthesis}, author = {Xiaopeng Wang and Chunyu Qiang and Ruibo Fu and Zhengqi Wen and Xuefei Liu and Yukun Liu and Yuzhe Liang and Kang Yin and Yuankun Xie and Heng Xie and Chenxing Li and Chen Zhang and Changsheng Li}, year = {2025}, url = {https://arxiv.org/abs/2512.04720}, note = {Source identifier: 2512.04720} }