@misc{indiciae76e6ec66701f, title = {VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text}, author = {Hassan Akbari and Liangzhe Yuan and Rui Qian and Wei-Hong Chuang and Shih-Fu Chang and Yin Cui and Boqing Gong}, year = {2021}, url = {https://arxiv.org/abs/2104.11178}, note = {Source identifier: 2104.11178} }