@misc{indiciae480d7487e98b, title = {EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer}, author = {Jiarui Hai and Yong Xu and Hao Zhang and Chenxing Li and Helin Wang and Mounya Elhilali and Dong Yu}, year = {2025}, url = {https://arxiv.org/abs/2409.10819}, note = {Source identifier: 2409.10819} }