TY - RPRT TI - Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction AU - Bowen Shi AU - Wei-Ning Hsu AU - Kushal Lakhotia AU - Abdelrahman Mohamed PY - 2022 UR - https://arxiv.org/abs/2201.02184 ID - 2201.02184 ER -