@misc{indiciaec4e2f26faeae, title = {CLIP Itself is a Strong Fine-tuner: Achieving 85.7\% and 88.0\% Top-1 Accuracy with ViT-B and ViT-L on ImageNet}, author = {Xiaoyi Dong and Jianmin Bao and Ting Zhang and Dongdong Chen and Shuyang Gu and Weiming Zhang and Lu Yuan and Dong Chen and Fang Wen and Nenghai Yu}, year = {2022}, url = {https://arxiv.org/abs/2212.06138}, note = {Source identifier: 2212.06138} }