@misc{indiciaef70db825bdaf, title = {Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training}, author = {Tongkun Su and Jun Li and Xi Zhang and Haibo Jin and Hao Chen and Qiong Wang and Faqin Lv and Baoliang Zhao and Yin Hu}, year = {2024}, url = {https://arxiv.org/abs/2404.00226}, note = {Source identifier: 2404.00226} }