@misc{indiciae6bad2d5466dc, title = {3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation}, author = {Yaoru Li and Heyu Si and Federico Landi and Pilar Oplustil Gallegos and Ioannis Koutsoumpas and O. Ricardo Cortez Vazquez and Ruiju Fu and Qi Guo and Xin Jin and Shunyu Liu and Mingli Song}, year = {2025}, url = {https://arxiv.org/abs/2511.21780}, note = {Source identifier: 2511.21780} }