@misc{indiciae4066252671ba, title = {An Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling}, author = {Tsu-Jui Fu and Linjie Li and Zhe Gan and Kevin Lin and William Yang Wang and Lijuan Wang and Zicheng Liu}, year = {2023}, url = {https://arxiv.org/abs/2209.01540}, note = {Source identifier: 2209.01540} }