@article{clipitselfisastrongfinetunerachieving, title = {CLIP Itself is a Strong Fine-tuner: Achieving 85.7% and 88.0% Top-1 Accuracy with ViT-B and ViT-L on ImageNet}, author = {Xiaoyi Dong and Jianmin Bao and Ting Zhang and Dongdong Chen and Shuyang Gu and Weiming Zhang and Lu Yuan and Dong Chen and Fang Wen and Nenghai Yu}, year = {2022}, eprint = {2212.06138}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2212.06138v1}, }