TY - RPRT TI - AV-data2vec: Self-supervised Learning of Audio-Visual Speech Representations with Contextualized Target Representations AU - Jiachen Lian AU - Alexei Baevski AU - Wei-Ning Hsu AU - Michael Auli PY - 2024 UR - https://arxiv.org/abs/2302.06419 ID - 2302.06419 ER -