@misc{indiciae42e343fdbdf1, title = {MM-LDM: Multi-Modal Latent Diffusion Model for Sounding Video Generation}, author = {Mingzhen Sun and Weining Wang and Yanyuan Qiao and Jiahui Sun and Zihan Qin and Longteng Guo and Xinxin Zhu and Jing Liu}, year = {2024}, url = {https://arxiv.org/abs/2410.01594}, note = {Source identifier: 2410.01594} }