TY - RPRT TI - SpeechCLIP+: Self-supervised multi-task representation learning for speech via CLIP and speech-image data AU - Hsuan-Fu Wang AU - Yi-Jen Shih AU - Heng-Jui Chang AU - Layne Berry AU - Puyuan Peng AU - Hung-yi Lee AU - Hsin-Min Wang AU - David Harwath PY - 2024 UR - https://arxiv.org/abs/2402.06959 ID - 2402.06959 ER -