@misc{indiciaec5ea4d186717, title = {PyramidCLIP: Hierarchical Feature Alignment for Vision-language Model Pretraining}, author = {Yuting Gao and Jinfeng Liu and Zihan Xu and Jun Zhang and Ke Li and Rongrong Ji and Chunhua Shen}, year = {2022}, url = {https://arxiv.org/abs/2204.14095}, note = {Source identifier: 2204.14095} }