@misc{indiciaeda2c9c820576, title = {Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization}, author = {Yang Jin and Zhicheng Sun and Kun Xu and Liwei Chen and Hao Jiang and Quzhe Huang and Chengru Song and Yuliang Liu and Di Zhang and Yang Song and Kun Gai and Yadong Mu}, year = {2024}, url = {https://arxiv.org/abs/2402.03161}, note = {Source identifier: 2402.03161} }