@misc{indiciaedaf55096ae0c, title = {Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction}, author = {Kaisi Guan and Xihua Wang and Zhengfeng Lai and Xin Cheng and Peng Zhang and XiaoJiang Liu and Ruihua Song and Meng Cao}, year = {2026}, url = {https://arxiv.org/abs/2510.03117}, note = {Source identifier: 2510.03117} }