TY - RPRT TI - Self-Supervised Representation Learning for Speech Using Visual Grounding and Masked Language Modeling AU - Puyuan Peng AU - David Harwath PY - 2022 UR - https://arxiv.org/abs/2202.03543 ID - 2202.03543 ER -