@misc{indiciaed953f42c7f7d, title = {JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing}, author = {Xiaohu Huang and Haoyang He and Hao Zhou and Qiangpeng Yang and Shilei Wen and Kai Han}, year = {2026}, url = {https://arxiv.org/abs/2512.13677}, note = {Source identifier: 2512.13677} }