@misc{indiciaef71c01af7206, title = {Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners}, author = {Yazhou Xing and Yingqing He and Zeyue Tian and Xintao Wang and Qifeng Chen}, year = {2024}, url = {https://arxiv.org/abs/2402.17723}, note = {Source identifier: 2402.17723} }