@misc{indiciaea851186f88ec, title = {mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video}, author = {Haiyang Xu and Qinghao Ye and Ming Yan and Yaya Shi and Jiabo Ye and Yuanhong Xu and Chenliang Li and Bin Bi and Qi Qian and Wei Wang and Guohai Xu and Ji Zhang and Songfang Huang and Fei Huang and Jingren Zhou}, year = {2023}, url = {https://arxiv.org/abs/2302.00402}, note = {Source identifier: 2302.00402} }