@misc{indiciaebf7e398564c8, title = {Hierarchical Codec Diffusion for Video-to-Speech Generation}, author = {Jiaxin Ye and Gaoxiang Cong and Chenhui Wang and Xin-Cheng Wen and Zhaoyang Li and Boyuan Cao and Hongming Shan}, year = {2026}, url = {https://arxiv.org/abs/2604.15923}, note = {Source identifier: 2604.15923} }