TY - RPRT TI - Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction AU - Kaisi Guan AU - Xihua Wang AU - Zhengfeng Lai AU - Xin Cheng AU - Peng Zhang AU - XiaoJiang Liu AU - Ruihua Song AU - Meng Cao PY - 2026 UR - https://arxiv.org/abs/2510.03117 ID - 2510.03117 ER -