@misc{indiciaef0ec73a6001a, title = {AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation}, author = {Le Wang and Jun Wang and Chunyu Qiang and Feng Deng and Chen Zhang and Di Zhang and Kun Gai}, year = {2025}, url = {https://arxiv.org/abs/2508.00733}, note = {Source identifier: 2508.00733} }