@misc{indiciae9ea99cb5613b, title = {Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation}, author = {Ye Tao and Lupeng Liu and Xuenan Xu and Jiasun Feng and Jiarui Wang and Ying Qin and Shuiyang Mao and Wei Liu and Shuai Wang}, year = {2026}, url = {https://arxiv.org/abs/2606.03672}, note = {Source identifier: 2606.03672} }