@misc{indiciae4d4fae18f4ba, title = {CLIPSonic: Text-to-Audio Synthesis with Unlabeled Videos and Pretrained Language-Vision Models}, author = {Hao-Wen Dong and Xiaoyu Liu and Jordi Pons and Gautam Bhattacharya and Santiago Pascual and Joan SerrĂ  and Taylor Berg-Kirkpatrick and Julian McAuley}, year = {2023}, url = {https://arxiv.org/abs/2306.09635}, note = {Source identifier: 2306.09635} }