TY - RPRT TI - Fuse after Align: Improving Face-Voice Association Learning via Multimodal Encoder AU - Chong Peng AU - Liqiang He AU - Dan Su PY - 2024 UR - https://arxiv.org/abs/2404.09509 ID - 2404.09509 ER -