TY - RPRT TI - Tell What You Hear From What You See -- Video to Audio Generation Through Text AU - Xiulong Liu AU - Kun Su AU - Eli Shlizerman PY - 2025 UR - https://arxiv.org/abs/2411.05679 ID - 2411.05679 ER -