@misc{indiciae2ed38e43de70, title = {AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation}, author = {Jeongsoo Choi and Ji-Hoon Kim and Kim Sung-Bin and Tae-Hyun Oh and Joon Son Chung}, year = {2025}, url = {https://arxiv.org/abs/2504.20629}, note = {Source identifier: 2504.20629} }