@misc{indiciaeb8564cd9a0e3, title = {VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling}, author = {Tsu-Jui Fu and Linjie Li and Zhe Gan and Kevin Lin and William Yang Wang and Lijuan Wang and Zicheng Liu}, year = {2022}, url = {https://arxiv.org/abs/2111.12681}, note = {Source identifier: 2111.12681} }