TY - RPRT TI - M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis AU - Xiaopeng Wang AU - Chunyu Qiang AU - Ruibo Fu AU - Zhengqi Wen AU - Xuefei Liu AU - Yukun Liu AU - Yuzhe Liang AU - Kang Yin AU - Yuankun Xie AU - Heng Xie AU - Chenxing Li AU - Chen Zhang AU - Changsheng Li PY - 2025 UR - https://arxiv.org/abs/2512.04720 ID - 2512.04720 ER -