@misc{indiciae4dac342d4bf4, title = {Omni2Sound: Towards Unified Video-Text-to-Audio Generation}, author = {Yusheng Dai and Zehua Chen and Yuxuan Jiang and Baolong Gao and Qiuhong Ke and Jianfei Cai and Jun Zhu}, year = {2026}, url = {https://arxiv.org/abs/2601.02731}, note = {Source identifier: 2601.02731} }