@misc{indiciae21788b886b0e, title = {AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control}, author = {Xinyue Guo and Xiaoran Yang and Lipan Zhang and Jianxuan Yang and Zhao Wang and Jian Luan}, year = {2025}, url = {https://arxiv.org/abs/2511.21146}, note = {Source identifier: 2511.21146} }