TY - RPRT TI - From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech AU - Ji-Hoon Kim AU - Jeongsoo Choi AU - Jaehun Kim AU - Chaeyoung Jung AU - Joon Son Chung PY - 2025 UR - https://arxiv.org/abs/2503.16956 ID - 2503.16956 ER -