@misc{indiciae3513f3e603fb, title = {CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction}, author = {Size Wu and Wenwei Zhang and Lumin Xu and Sheng Jin and Xiangtai Li and Wentao Liu and Chen Change Loy}, year = {2024}, url = {https://arxiv.org/abs/2310.01403}, note = {Source identifier: 2310.01403} }