@misc{indiciae3c5d085f7774, title = {Clover: Towards A Unified Video-Language Alignment and Fusion Model}, author = {Jingjia Huang and Yinan Li and Jiashi Feng and Xinglong Wu and Xiaoshuai Sun and Rongrong Ji}, year = {2022}, url = {https://arxiv.org/abs/2207.07885}, note = {Source identifier: 2207.07885} }