TY - RPRT TI - V-CASS: Vision-context-aware Expressive Speech Synthesis for Enhancing User Understanding of Videos AU - Qixin Wang AU - Songtao Zhou AU - Zeyu Jin AU - Chenglin Guo AU - Shikun Sun AU - Xiaoyu Qin PY - 2025 UR - https://arxiv.org/abs/2506.16716 ID - 2506.16716 ER -