@misc{indiciae09df0646f692, title = {UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation}, author = {Huaishao Luo and Lei Ji and Botian Shi and Haoyang Huang and Nan Duan and Tianrui Li and Jason Li and Taroon Bharti and Ming Zhou}, year = {2020}, url = {https://arxiv.org/abs/2002.06353}, note = {Source identifier: 2002.06353} }