@misc{indiciae8ef5aeb53185, title = {Refined Vision-Language Modeling for Fine-grained Multi-modal Pre-training}, author = {Lisai Zhang and Qingcai Chen and Zhijian Chen and Yunpeng Han and Zhonghua Li and Zhao Cao}, year = {2023}, url = {https://arxiv.org/abs/2303.05313}, note = {Source identifier: 2303.05313} }