TY - RPRT TI - SpeechCLIP: Integrating Speech with Pre-Trained Vision and Language Model AU - Yi-Jen Shih AU - Hsuan-Fu Wang AU - Heng-Jui Chang AU - Layne Berry AU - Hung-yi Lee AU - David Harwath PY - 2022 UR - https://arxiv.org/abs/2210.00705 ID - 2210.00705 ER -