TY - RPRT TI - VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text AU - Hassan Akbari AU - Liangzhe Yuan AU - Rui Qian AU - Wei-Hong Chuang AU - Shih-Fu Chang AU - Yin Cui AU - Boqing Gong PY - 2021 UR - https://arxiv.org/abs/2104.11178 ID - 2104.11178 ER -