{"task":"Image Classification","dataset":"ObjectNet","metric_names":["Top-1 Accuracy","Top-5 Accuracy"],"rows":[{"id":66610,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"CoCa","metrics":{"Top-1 Accuracy":"82.7"},"paper_url":"https://arxiv.org/abs/2205.01917v2","paper_title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","paper_date":"2022-05-04","code_links":[{"title":"mlfoundations/open_clip","url":"https://github.com/mlfoundations/open_clip"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"lucidrains/CoCa-pytorch","url":"https://github.com/lucidrains/CoCa-pytorch"},{"title":"amitakamath/whatsup_vlms","url":"https://github.com/amitakamath/whatsup_vlms"},{"title":"amitakamath/hard_positives","url":"https://github.com/amitakamath/hard_positives"},{"title":"Chaolei98/FreeZAD","url":"https://github.com/Chaolei98/FreeZAD"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66611,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"LiT","metrics":{"Top-1 Accuracy":"82.5"},"paper_url":"https://arxiv.org/abs/2111.07991v3","paper_title":"LiT: Zero-Shot Transfer with Locked-image text Tuning","paper_date":"2021-11-15","code_links":[{"title":"mlfoundations/open_clip","url":"https://github.com/mlfoundations/open_clip"},{"title":"google-research/vision_transformer","url":"https://github.com/google-research/vision_transformer"},{"title":"google-research/big_vision","url":"https://github.com/google-research/big_vision"},{"title":"laion-ai/clip_benchmark","url":"https://github.com/laion-ai/clip_benchmark"},{"title":"eify/clip_benchmark","url":"https://github.com/eify/clip_benchmark"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66612,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"BASIC","metrics":{"Top-1 Accuracy":"82.3"},"paper_url":"https://arxiv.org/abs/2111.10050v3","paper_title":"Combined Scaling for Zero-shot Transfer Learning","paper_date":"2021-11-19","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66613,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"EVA-02-CLIP-E/14+","metrics":{"Top-1 Accuracy":"79.6"},"paper_url":"https://arxiv.org/abs/2303.15389v1","paper_title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","paper_date":"2023-03-27","code_links":[{"title":"baaivision/eva","url":"https://github.com/baaivision/eva"},{"title":"PaddlePaddle/PaddleMIX","url":"https://github.com/PaddlePaddle/PaddleMIX/tree/develop/paddlemix/examples"},{"title":"Yui010206/CREMA","url":"https://github.com/Yui010206/CREMA"},{"title":"jaehong31/raccoon","url":"https://github.com/jaehong31/raccoon"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66614,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"Baseline (ViT-G/14)","metrics":{"Top-1 Accuracy":"79.03"},"paper_url":"https://arxiv.org/abs/2203.05482v3","paper_title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","paper_date":"2022-03-10","code_links":[{"title":"mlfoundations/model-soups","url":"https://github.com/mlfoundations/model-soups"},{"title":"Burf/ModelSoups","url":"https://github.com/Burf/ModelSoups"},{"title":"facebookresearch/ModelRatatouille","url":"https://github.com/facebookresearch/ModelRatatouille"},{"title":"hwk0702/keras2torch","url":"https://github.com/hwk0702/keras2torch/tree/main/Computer_Vision/Model_Soup"},{"title":"flowritecom/flow-merge","url":"https://github.com/flowritecom/flow-merge"},{"title":"shallowlearn/sportsreid","url":"https://github.com/shallowlearn/sportsreid"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66615,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"Model soups (ViT-G/14)","metrics":{"Top-1 Accuracy":"78.52"},"paper_url":"https://arxiv.org/abs/2203.05482v3","paper_title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","paper_date":"2022-03-10","code_links":[{"title":"mlfoundations/model-soups","url":"https://github.com/mlfoundations/model-soups"},{"title":"Burf/ModelSoups","url":"https://github.com/Burf/ModelSoups"},{"title":"facebookresearch/ModelRatatouille","url":"https://github.com/facebookresearch/ModelRatatouille"},{"title":"hwk0702/keras2torch","url":"https://github.com/hwk0702/keras2torch/tree/main/Computer_Vision/Model_Soup"},{"title":"flowritecom/flow-merge","url":"https://github.com/flowritecom/flow-merge"},{"title":"shallowlearn/sportsreid","url":"https://github.com/shallowlearn/sportsreid"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66616,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"MAWS (ViT-6.5B)","metrics":{"Top-1 Accuracy":"77.9"},"paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","paper_date":"2023-03-23","code_links":[{"title":"facebookresearch/maws","url":"https://github.com/facebookresearch/maws"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66617,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"MAWS (ViT-2B)","metrics":{"Top-1 Accuracy":"75.8"},"paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","paper_date":"2023-03-23","code_links":[{"title":"facebookresearch/maws","url":"https://github.com/facebookresearch/maws"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66618,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"MAWS (ViT-H)","metrics":{"Top-1 Accuracy":"72.6"},"paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","paper_date":"2023-03-23","code_links":[{"title":"facebookresearch/maws","url":"https://github.com/facebookresearch/maws"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66619,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"CLIP","metrics":{"Top-1 Accuracy":"72.3"},"paper_url":"https://arxiv.org/abs/2103.00020v1","paper_title":"Learning Transferable Visual Models From Natural Language Supervision","paper_date":"2021-02-26","code_links":[{"title":"openai/CLIP","url":"https://github.com/openai/CLIP"},{"title":"mlfoundations/open_clip","url":"https://github.com/mlfoundations/open_clip"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/vissl","url":"https://github.com/facebookresearch/vissl"},{"title":"alibaba/EasyNLP","url":"https://github.com/alibaba/EasyNLP"},{"title":"apple/ml-mobileclip","url":"https://github.com/apple/ml-mobileclip"},{"title":"OML-Team/open-metric-learning","url":"https://github.com/OML-Team/open-metric-learning"},{"title":"FreddeFrallan/Multilingual-CLIP","url":"https://github.com/FreddeFrallan/Multilingual-CLIP"},{"title":"eps696/aphantasia","url":"https://github.com/eps696/aphantasia"},{"title":"muzairkhattak/multimodal-prompt-learning","url":"https://github.com/muzairkhattak/multimodal-prompt-learning"},{"title":"moein-shariatnia/OpenAI-CLIP","url":"https://github.com/moein-shariatnia/OpenAI-CLIP"},{"title":"facebookresearch/brainmagick","url":"https://github.com/facebookresearch/brainmagick"},{"title":"PaddlePaddle/PASSL","url":"https://github.com/PaddlePaddle/PASSL/blob/main/docs/Train_CLIP_model.md"},{"title":"taited/clip-score","url":"https://github.com/taited/clip-score"},{"title":"azshue/TPT","url":"https://github.com/azshue/TPT"},{"title":"clip-italian/clip-italian","url":"https://github.com/clip-italian/clip-italian"},{"title":"dhansmair/flamingo-mini","url":"https://github.com/dhansmair/flamingo-mini"},{"title":"ylqi/count-anything","url":"https://github.com/ylqi/count-anything"},{"title":"ml-jku/cloob","url":"https://github.com/ml-jku/cloob"},{"title":"sberbank-ai/ru-clip","url":"https://github.com/sberbank-ai/ru-clip"},{"title":"ai-forever/ru-clip","url":"https://github.com/ai-forever/ru-clip"},{"title":"Kaushalya/medclip","url":"https://github.com/Kaushalya/medclip"},{"title":"ajayjain/vectorascent","url":"https://github.com/ajayjain/vectorascent"},{"title":"linjieli222/hero_video_feature_extractor","url":"https://github.com/linjieli222/hero_video_feature_extractor"},{"title":"borisdayma/clip-jax","url":"https://github.com/borisdayma/clip-jax"},{"title":"sajjjadayobi/CLIPfa","url":"https://github.com/sajjjadayobi/CLIPfa"},{"title":"mertyg/post-hoc-cbm","url":"https://github.com/mertyg/post-hoc-cbm"},{"title":"mlbio-epfl/turtle","url":"https://github.com/mlbio-epfl/turtle"},{"title":"rinnakk/japanese-clip","url":"https://github.com/rinnakk/japanese-clip"},{"title":"salesforce/pb-ovd","url":"https://github.com/salesforce/pb-ovd"},{"title":"facebookresearch/clip-rocket","url":"https://github.com/facebookresearch/clip-rocket"},{"title":"sincerass/mvlpt","url":"https://github.com/sincerass/mvlpt"},{"title":"ericyinyzy/vlattack","url":"https://github.com/ericyinyzy/vlattack"},{"title":"redcaps-dataset/redcaps-downloader","url":"https://github.com/redcaps-dataset/redcaps-downloader"},{"title":"bespontaneous/proteus-pytorch","url":"https://github.com/bespontaneous/proteus-pytorch"},{"title":"shunk031/simple-aesthetics-predictor","url":"https://github.com/shunk031/simple-aesthetics-predictor"},{"title":"giantseaweed/decree","url":"https://github.com/giantseaweed/decree"},{"title":"sithu31296/simple-object-tracking","url":"https://github.com/sithu31296/simple-object-tracking"},{"title":"Gahyeonkim09/AAPL","url":"https://github.com/Gahyeonkim09/AAPL"},{"title":"filipbasara0/simple-clip","url":"https://github.com/filipbasara0/simple-clip"},{"title":"michi-3000/eyeclip","url":"https://github.com/michi-3000/eyeclip"},{"title":"baskargroup/Arboretum","url":"https://github.com/baskargroup/Arboretum"},{"title":"baskargroup/biotrove","url":"https://github.com/baskargroup/biotrove"},{"title":"kynkaat/role-of-imagenet-classes-in-fid","url":"https://github.com/kynkaat/role-of-imagenet-classes-in-fid"},{"title":"SforAiDl/CountCLIP","url":"https://github.com/SforAiDl/CountCLIP"},{"title":"mainaksingha01/applenet","url":"https://github.com/mainaksingha01/applenet"},{"title":"zhangxu0963/npc","url":"https://github.com/zhangxu0963/npc"},{"title":"mainaksingha01/odg-clip","url":"https://github.com/mainaksingha01/odg-clip"},{"title":"jhaprince/multibully","url":"https://github.com/jhaprince/multibully"},{"title":"klemens-floege/oneprot","url":"https://github.com/klemens-floege/oneprot"},{"title":"leolee99/CLIP_ITM","url":"https://github.com/leolee99/CLIP_ITM"},{"title":"madrylab/pretraining-distribution-shift-robustness","url":"https://github.com/madrylab/pretraining-distribution-shift-robustness"},{"title":"AndresPMD/Clip_CMR","url":"https://github.com/AndresPMD/Clip_CMR"},{"title":"fastscience-ai/medflamingo","url":"https://github.com/fastscience-ai/medflamingo"},{"title":"buyeah1109/KEN","url":"https://github.com/buyeah1109/KEN"},{"title":"pseulki/rococo","url":"https://github.com/pseulki/rococo"},{"title":"shkarupa-alex/tfclip","url":"https://github.com/shkarupa-alex/tfclip"},{"title":"IMvision12/keras-vision-models","url":"https://github.com/IMvision12/keras-vision-models"},{"title":"brown-palm/ObjectPrompt","url":"https://github.com/brown-palm/ObjectPrompt"},{"title":"YvanG/VQGAN-CLIP","url":"https://github.com/YvanG/VQGAN-CLIP"},{"title":"ramanakshay/clip","url":"https://github.com/ramanakshay/clip"},{"title":"NYU-DICE-Lab/open_clip","url":"https://github.com/NYU-DICE-Lab/open_clip"},{"title":"shivammehta25/clip","url":"https://github.com/shivammehta25/clip"},{"title":"minhanh151/respro","url":"https://github.com/minhanh151/respro"},{"title":"nopperl/clip_arxiv_pmc","url":"https://github.com/nopperl/clip_arxiv_pmc"},{"title":"s-a-malik/multi-few","url":"https://github.com/s-a-malik/multi-few"},{"title":"prabhupad26/100daysofML","url":"https://github.com/prabhupad26/100daysofML"},{"title":"armaank/archlectures","url":"https://github.com/armaank/archlectures"},{"title":"minhanh151/pre","url":"https://github.com/minhanh151/pre"},{"title":"yuuun/clip_pytorch","url":"https://github.com/yuuun/clip_pytorch"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/clip"},{"title":"lunaproject22/rpa","url":"https://github.com/lunaproject22/rpa"},{"title":"fiabdu/Commonly-Interesting-Images","url":"https://github.com/fiabdu/Commonly-Interesting-Images"},{"title":"iejMac/ScriptWriter","url":"https://github.com/iejMac/ScriptWriter"},{"title":"ZackPashkin/text2cartoon-pytorch-CLIP","url":"https://github.com/ZackPashkin/text2cartoon-pytorch-CLIP"},{"title":"bruthyu/bpt-vlm","url":"https://github.com/bruthyu/bpt-vlm"},{"title":"buyeah1109/finc","url":"https://github.com/buyeah1109/finc"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/clip"},{"title":"eify/open_clip","url":"https://github.com/eify/open_clip"},{"title":"2023-MindSpore-4/Code12","url":"https://github.com/2023-MindSpore-4/Code12/tree/main/MindFormers/clip"},{"title":"a736875071/clip-vit-large-patch14","url":"https://github.com/a736875071/clip-vit-large-patch14"},{"title":"nahidalam/open_clip","url":"https://github.com/nahidalam/open_clip"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66620,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ALIGN","metrics":{"Top-1 Accuracy":"72.2"},"paper_url":"https://arxiv.org/abs/2111.10050v3","paper_title":"Combined Scaling for Zero-shot Transfer Learning","paper_date":"2021-11-19","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66621,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"WiSE-FT","metrics":{"Top-1 Accuracy":"72.1"},"paper_url":"https://arxiv.org/abs/2109.01903v3","paper_title":"Robust fine-tuning of zero-shot models","paper_date":"2021-09-04","code_links":[{"title":"mlfoundations/wise-ft","url":"https://github.com/mlfoundations/wise-ft"},{"title":"mlfoundations/model-soups","url":"https://github.com/mlfoundations/model-soups"},{"title":"ivanaer/g-universal-clip","url":"https://github.com/ivanaer/g-universal-clip"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66622,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-e","metrics":{"Top-1 Accuracy":"72.0"},"paper_url":"https://arxiv.org/abs/2209.06794v4","paper_title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","paper_date":"2022-09-14","code_links":[{"title":"google-research/big_vision","url":"https://github.com/google-research/big_vision"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":0,"source":"archive","tags":[]},{"id":66623,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-G/14","metrics":{"Top-1 Accuracy":"70.53"},"paper_url":"https://arxiv.org/abs/2106.04560v2","paper_title":"Scaling Vision Transformers","paper_date":"2021-06-08","code_links":[{"title":"google-research/big_vision","url":"https://github.com/google-research/big_vision"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66624,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"SWAG (ViT H/14)","metrics":{"Top-1 Accuracy":"69.5"},"paper_url":"https://arxiv.org/abs/2201.08371v2","paper_title":"Revisiting Weakly Supervised Pre-Training of Visual Perception Models","paper_date":"2022-01-20","code_links":[{"title":"facebookresearch/SWAG","url":"https://github.com/facebookresearch/SWAG"},{"title":"Expedit-LargeScale-Vision-Transformer/Expedit-SWAG","url":"https://github.com/Expedit-LargeScale-Vision-Transformer/Expedit-SWAG"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66625,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"NS (Eff.-L2)","metrics":{"Top-1 Accuracy":"68.5"},"paper_url":"https://arxiv.org/abs/2106.04560v2","paper_title":"Scaling Vision Transformers","paper_date":"2021-06-08","code_links":[{"title":"google-research/big_vision","url":"https://github.com/google-research/big_vision"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66626,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RegNetY 128GF (Platt)","metrics":{"Top-1 Accuracy":"64.3"},"paper_url":"https://arxiv.org/abs/2201.08371v2","paper_title":"Revisiting Weakly Supervised Pre-Training of Visual Perception Models","paper_date":"2022-01-20","code_links":[{"title":"facebookresearch/SWAG","url":"https://github.com/facebookresearch/SWAG"},{"title":"Expedit-LargeScale-Vision-Transformer/Expedit-SWAG","url":"https://github.com/Expedit-LargeScale-Vision-Transformer/Expedit-SWAG"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66627,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"LLE (ViT-H/14, MAE, Edge Aug)","metrics":{"Top-1 Accuracy":"60.78"},"paper_url":"https://arxiv.org/abs/2212.04825v2","paper_title":"A Whac-A-Mole Dilemma: Shortcuts Come in Multiples Where Mitigating One Amplifies Others","paper_date":"2022-12-09","code_links":[{"title":"facebookresearch/Whac-A-Mole","url":"https://github.com/facebookresearch/Whac-A-Mole"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":0,"source":"archive","tags":[]},{"id":66628,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"SEER (RegNet10B)","metrics":{"Top-1 Accuracy":"60.2"},"paper_url":"https://arxiv.org/abs/2202.08360v2","paper_title":"Vision Models Are More Robust And Fair When Pretrained On Uncurated Images Without Supervision","paper_date":"2022-02-16","code_links":[{"title":"facebookresearch/vissl","url":"https://github.com/facebookresearch/vissl"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66629,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT H/14 (Platt)","metrics":{"Top-1 Accuracy":"60"},"paper_url":"https://arxiv.org/abs/2201.08371v2","paper_title":"Revisiting Weakly Supervised Pre-Training of Visual Perception Models","paper_date":"2022-01-20","code_links":[{"title":"facebookresearch/SWAG","url":"https://github.com/facebookresearch/SWAG"},{"title":"Expedit-LargeScale-Vision-Transformer/Expedit-SWAG","url":"https://github.com/Expedit-LargeScale-Vision-Transformer/Expedit-SWAG"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66630,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"BiT-L (ResNet-152x4)","metrics":{"Top-1 Accuracy":"58.7","Top-5 Accuracy":"80"},"paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","paper_date":"2019-12-24","code_links":[{"title":"google-research/big_transfer","url":"https://github.com/google-research/big_transfer"},{"title":"sayakpaul/FunMatch-Distillation","url":"https://github.com/sayakpaul/FunMatch-Distillation"},{"title":"bethgelab/InDomainGeneralizationBenchmark","url":"https://github.com/bethgelab/InDomainGeneralizationBenchmark"},{"title":"SoojungYang/supervised_pretraining_GN_WS","url":"https://github.com/SoojungYang/supervised_pretraining_GN_WS"},{"title":"sayakpaul/A-Barebones-Image-Retrieval-System","url":"https://github.com/sayakpaul/A-Barebones-Image-Retrieval-System"},{"title":"batsresearch/taglets","url":"https://github.com/batsresearch/taglets"},{"title":"MS-Mind/MS-Code-02","url":"https://github.com/MS-Mind/MS-Code-02/tree/main/configs/bit"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/bit"},{"title":"hw666666666666/BigTransfer","url":"https://github.com/hw666666666666/BigTransfer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66631,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT L/16 (Platt)","metrics":{"Top-1 Accuracy":"57.3"},"paper_url":"https://arxiv.org/abs/2201.08371v2","paper_title":"Revisiting Weakly Supervised Pre-Training of Visual Perception Models","paper_date":"2022-01-20","code_links":[{"title":"facebookresearch/SWAG","url":"https://github.com/facebookresearch/SWAG"},{"title":"Expedit-LargeScale-Vision-Transformer/Expedit-SWAG","url":"https://github.com/Expedit-LargeScale-Vision-Transformer/Expedit-SWAG"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66632,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"Vit B/16 (Bamboo)","metrics":{"Top-1 Accuracy":"53.9"},"paper_url":"https://arxiv.org/abs/2203.07845v2","paper_title":"Bamboo: Building Mega-Scale Vision Dataset Continually with Human-Machine Synergy","paper_date":"2022-03-15","code_links":[{"title":"zhangyuanhan-ai/bamboo","url":"https://github.com/zhangyuanhan-ai/bamboo"},{"title":"davidzhangyuanhan/bamboo","url":"https://github.com/davidzhangyuanhan/bamboo"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66633,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"AR-L (Opt Relevance)","metrics":{"Top-1 Accuracy":"52.0","Top-5 Accuracy":"73.5"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66634,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ALIGN-MRL","metrics":{"Top-1 Accuracy":"51.6"},"paper_url":"https://arxiv.org/abs/2205.13147v4","paper_title":"Matryoshka Representation Learning","paper_date":"2022-05-26","code_links":[{"title":"novasearch-team/rag-retrieval","url":"https://github.com/novasearch-team/rag-retrieval"},{"title":"raivnlab/mrl","url":"https://github.com/raivnlab/mrl"},{"title":"scaledfoundations/matmamba","url":"https://github.com/scaledfoundations/matmamba"},{"title":"krypticmouse/matryoshka-representation-learning","url":"https://github.com/krypticmouse/matryoshka-representation-learning"},{"title":"filipbasara0/matryoshka-representation-learning","url":"https://github.com/filipbasara0/matryoshka-representation-learning"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66635,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-B/16 (ANN-1.3B)","metrics":{"Top-1 Accuracy":"50.7"},"paper_url":"https://arxiv.org/abs/2108.05887v1","paper_title":"Billion-Scale Pretraining with Vision Transformers for Multi-Task Visual Representations","paper_date":"2021-08-12","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66636,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-B/16 (512x512) + Pyramid","metrics":{"Top-1 Accuracy":"49.39"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66637,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-101 (JFT-300M)","metrics":{"Top-1 Accuracy":"49.1"},"paper_url":"https://arxiv.org/abs/2108.05887v1","paper_title":"Billion-Scale Pretraining with Vision Transformers for Multi-Task Visual Representations","paper_date":"2021-08-12","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66638,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT B/16","metrics":{"Top-1 Accuracy":"48.9"},"paper_url":"https://arxiv.org/abs/2201.08371v2","paper_title":"Revisiting Weakly Supervised Pre-Training of Visual Perception Models","paper_date":"2022-01-20","code_links":[{"title":"facebookresearch/SWAG","url":"https://github.com/facebookresearch/SWAG"},{"title":"Expedit-LargeScale-Vision-Transformer/Expedit-SWAG","url":"https://github.com/Expedit-LargeScale-Vision-Transformer/Expedit-SWAG"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66639,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-B/32","metrics":{"Top-1 Accuracy":"48.4"},"paper_url":"https://arxiv.org/abs/2108.05887v1","paper_title":"Billion-Scale Pretraining with Vision Transformers for Multi-Task Visual Representations","paper_date":"2021-08-12","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66640,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-B/16 (512x512) + Pixel","metrics":{"Top-1 Accuracy":"47.53"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66641,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"AR-B (Opt Relevance)","metrics":{"Top-1 Accuracy":"47.1","Top-5 Accuracy":"70"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66642,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"BiT-M (ResNet-152x4)","metrics":{"Top-1 Accuracy":"47.0","Top-5 Accuracy":"69"},"paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","paper_date":"2019-12-24","code_links":[{"title":"google-research/big_transfer","url":"https://github.com/google-research/big_transfer"},{"title":"sayakpaul/FunMatch-Distillation","url":"https://github.com/sayakpaul/FunMatch-Distillation"},{"title":"bethgelab/InDomainGeneralizationBenchmark","url":"https://github.com/bethgelab/InDomainGeneralizationBenchmark"},{"title":"SoojungYang/supervised_pretraining_GN_WS","url":"https://github.com/SoojungYang/supervised_pretraining_GN_WS"},{"title":"sayakpaul/A-Barebones-Image-Retrieval-System","url":"https://github.com/sayakpaul/A-Barebones-Image-Retrieval-System"},{"title":"batsresearch/taglets","url":"https://github.com/batsresearch/taglets"},{"title":"MS-Mind/MS-Code-02","url":"https://github.com/MS-Mind/MS-Code-02/tree/main/configs/bit"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/bit"},{"title":"hw666666666666/BigTransfer","url":"https://github.com/hw666666666666/BigTransfer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66643,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-B/16 (512x512)","metrics":{"Top-1 Accuracy":"46.68"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66644,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-B (Discrete 512x512)","metrics":{"Top-1 Accuracy":"46.62"},"paper_url":"https://arxiv.org/abs/2111.10493v2","paper_title":"Discrete Representations Strengthen Vision Transformer Robustness","paper_date":"2021-11-20","code_links":[{"title":"alibaba/easyrobust","url":"https://github.com/alibaba/easyrobust/tree/main/examples/imageclassification/imagenet/drvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66645,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"AR-L","metrics":{"Top-1 Accuracy":"46.5","Top-5 Accuracy":"68.3"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66646,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-L (Opt Relevance)","metrics":{"Top-1 Accuracy":"43.2","Top-5 Accuracy":"65.8"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66647,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"CLIP L","metrics":{"Top-1 Accuracy":"42.80"},"paper_url":"https://arxiv.org/abs/2201.00057v2","paper_title":"Optimal Representations for Covariate Shift","paper_date":"2021-12-31","code_links":[{"title":"facebookresearch/DomainBed","url":"https://github.com/facebookresearch/DomainBed"},{"title":"ryoungj/optdom","url":"https://github.com/ryoungj/optdom"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66648,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-50 (JFT-300M)","metrics":{"Top-1 Accuracy":"42.5"},"paper_url":"https://arxiv.org/abs/2108.05887v1","paper_title":"Billion-Scale Pretraining with Vision Transformers for Multi-Task Visual Representations","paper_date":"2021-08-12","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66649,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-B (Opt Relevance)","metrics":{"Top-1 Accuracy":"42.2","Top-5 Accuracy":"65.1"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66650,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"CLIP L (LAION)","metrics":{"Top-1 Accuracy":"42.10"},"paper_url":"https://arxiv.org/abs/2201.00057v2","paper_title":"Optimal Representations for Covariate Shift","paper_date":"2021-12-31","code_links":[{"title":"facebookresearch/DomainBed","url":"https://github.com/facebookresearch/DomainBed"},{"title":"ryoungj/optdom","url":"https://github.com/ryoungj/optdom"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66651,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"AR-B","metrics":{"Top-1 Accuracy":"41.4","Top-5 Accuracy":"63.7"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66652,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RegViT on 384x384 + Adv Pyramid","metrics":{"Top-1 Accuracy":"39.79"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66653,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-152 + GenInt with Transfer","metrics":{"Top-1 Accuracy":"39.38","Top-5 Accuracy":"61.43"},"paper_url":"https://arxiv.org/abs/2012.12265v2","paper_title":"Generative Interventions for Causal Learning","paper_date":"2020-12-22","code_links":[{"title":"cvlab-columbia/GenInt","url":"https://github.com/cvlab-columbia/GenInt"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66654,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"AR-S (Opt Relevance)","metrics":{"Top-1 Accuracy":"39.3","Top-5 Accuracy":"61.7"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66655,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-50 (Bamboo)","metrics":{"Top-1 Accuracy":"38.8"},"paper_url":"https://arxiv.org/abs/2203.07845v2","paper_title":"Bamboo: Building Mega-Scale Vision Dataset Continually with Human-Machine Synergy","paper_date":"2022-03-15","code_links":[{"title":"zhangyuanhan-ai/bamboo","url":"https://github.com/zhangyuanhan-ai/bamboo"},{"title":"davidzhangyuanhan/bamboo","url":"https://github.com/davidzhangyuanhan/bamboo"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66656,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RegViT on 384x384 + Adv Pixel","metrics":{"Top-1 Accuracy":"37.41"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66657,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-L","metrics":{"Top-1 Accuracy":"37.4","Top-5 Accuracy":"59.5"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66658,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"DeiT-L (Opt Relevance)","metrics":{"Top-1 Accuracy":"36.3","Top-5 Accuracy":"56.6"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66659,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"BiT-S (ResNet-152x4)","metrics":{"Top-1 Accuracy":"36.0","Top-5 Accuracy":"57"},"paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","paper_date":"2019-12-24","code_links":[{"title":"google-research/big_transfer","url":"https://github.com/google-research/big_transfer"},{"title":"sayakpaul/FunMatch-Distillation","url":"https://github.com/sayakpaul/FunMatch-Distillation"},{"title":"bethgelab/InDomainGeneralizationBenchmark","url":"https://github.com/bethgelab/InDomainGeneralizationBenchmark"},{"title":"SoojungYang/supervised_pretraining_GN_WS","url":"https://github.com/SoojungYang/supervised_pretraining_GN_WS"},{"title":"sayakpaul/A-Barebones-Image-Retrieval-System","url":"https://github.com/sayakpaul/A-Barebones-Image-Retrieval-System"},{"title":"batsresearch/taglets","url":"https://github.com/batsresearch/taglets"},{"title":"MS-Mind/MS-Code-02","url":"https://github.com/MS-Mind/MS-Code-02/tree/main/configs/bit"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/bit"},{"title":"hw666666666666/BigTransfer","url":"https://github.com/hw666666666666/BigTransfer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66660,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"NASNet-A","metrics":{"Top-1 Accuracy":"35.77","Top-5 Accuracy":"56.05"},"paper_url":"http://papers.nips.cc/paper/9142-objectnet-a-large-scale-bias-controlled-dataset-for-pushing-the-limits-of-object-recognition-models","paper_title":"ObjectNet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","paper_date":"2019-12-01","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66661,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"PNASNet-5L","metrics":{"Top-1 Accuracy":"35.63","Top-5 Accuracy":"54.95"},"paper_url":"http://papers.nips.cc/paper/9142-objectnet-a-large-scale-bias-controlled-dataset-for-pushing-the-limits-of-object-recognition-models","paper_title":"ObjectNet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","paper_date":"2019-12-01","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66662,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RegViT on 384x384","metrics":{"Top-1 Accuracy":"35.59"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66663,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-B","metrics":{"Top-1 Accuracy":"35.1","Top-5 Accuracy":"56.4"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66664,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RegViT on 384x384 + Random Pyramid","metrics":{"Top-1 Accuracy":"34.83"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66665,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"AR-S","metrics":{"Top-1 Accuracy":"34.3","Top-5 Accuracy":"55.8"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66666,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RegViT on 384x384 + Random Pixel","metrics":{"Top-1 Accuracy":"34.12"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66667,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RegViT (RandAug) + Adv Pyramid","metrics":{"Top-1 Accuracy":"32.92"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66668,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"Inception-v4","metrics":{"Top-1 Accuracy":"32.24","Top-5 Accuracy":"51.98"},"paper_url":"http://papers.nips.cc/paper/9142-objectnet-a-large-scale-bias-controlled-dataset-for-pushing-the-limits-of-object-recognition-models","paper_title":"ObjectNet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","paper_date":"2019-12-01","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66669,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"DeiT-S (Opt Relevance)","metrics":{"Top-1 Accuracy":"31.6","Top-5 Accuracy":"53"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66670,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-50 + CGC","metrics":{"Top-1 Accuracy":"31.53","Top-5 Accuracy":"50.16"},"paper_url":"https://arxiv.org/abs/1910.05577v4","paper_title":"Context-Gated Convolution","paper_date":"2019-10-12","code_links":[{"title":"XudongLinthu/context-gated-convolution","url":"https://github.com/XudongLinthu/context-gated-convolution"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66671,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"DeiT-L","metrics":{"Top-1 Accuracy":"31.4","Top-5 Accuracy":"48.5"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66672,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"Discrete ViT + Pixel","metrics":{"Top-1 Accuracy":"30.98"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66673,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"Discrete ViT + Pyramid","metrics":{"Top-1 Accuracy":"30.28"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66674,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RegViT (RandAug) + Adv Pixel","metrics":{"Top-1 Accuracy":"30.11"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66675,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"Discrete ViT","metrics":{"Top-1 Accuracy":"29.95"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66676,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-152","metrics":{"Top-1 Accuracy":"29.59","Top-5 Accuracy":"49.4"},"paper_url":"http://papers.nips.cc/paper/9142-objectnet-a-large-scale-bias-controlled-dataset-for-pushing-the-limits-of-object-recognition-models","paper_title":"ObjectNet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","paper_date":"2019-12-01","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66677,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RegViT (RandAug) + Random Pyramid","metrics":{"Top-1 Accuracy":"29.41"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66678,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RegViT (RandAug)","metrics":{"Top-1 Accuracy":"29.3"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66679,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-50 + GroupNorm","metrics":{"Top-1 Accuracy":"29.2","Top-5 Accuracy":"50.2"},"paper_url":"https://arxiv.org/abs/2006.16971v2","paper_title":"Improving robustness against common corruptions by covariate shift adaptation","paper_date":"2020-06-30","code_links":[{"title":"bethgelab/robustness","url":"https://github.com/bethgelab/robustness"},{"title":"Claydon-Wang/OFTTA","url":"https://github.com/Claydon-Wang/OFTTA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66680,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-50 + RoHL","metrics":{"Top-1 Accuracy":"29.2"},"paper_url":"https://arxiv.org/abs/2006.16971v2","paper_title":"Improving robustness against common corruptions by covariate shift adaptation","paper_date":"2020-06-30","code_links":[{"title":"bethgelab/robustness","url":"https://github.com/bethgelab/robustness"},{"title":"Claydon-Wang/OFTTA","url":"https://github.com/Claydon-Wang/OFTTA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66681,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RegViT (RandAug) + Random Pixel","metrics":{"Top-1 Accuracy":"28.72"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66682,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"MLP-Mixer + Pyramid","metrics":{"Top-1 Accuracy":"28.6"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66683,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-50 + FixUp","metrics":{"Top-1 Accuracy":"28.5","Top-5 Accuracy":"48.6"},"paper_url":"https://arxiv.org/abs/2006.16971v2","paper_title":"Improving robustness against common corruptions by covariate shift adaptation","paper_date":"2020-06-30","code_links":[{"title":"bethgelab/robustness","url":"https://github.com/bethgelab/robustness"},{"title":"Claydon-Wang/OFTTA","url":"https://github.com/Claydon-Wang/OFTTA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66684,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-50 + MixUp (rescaled)","metrics":{"Top-1 Accuracy":"28.37"},"paper_url":"https://arxiv.org/abs/2006.06049v3","paper_title":"On Mixup Regularization","paper_date":"2020-06-10","code_links":[{"title":"google/uncertainty-baselines","url":"https://github.com/google/uncertainty-baselines/tree/master/baselines/imagenet"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66685,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"DeiT-S","metrics":{"Top-1 Accuracy":"28.3","Top-5 Accuracy":"47.3"},"paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","paper_date":"2022-06-02","code_links":[{"title":"hila-chefer/robustvit","url":"https://github.com/hila-chefer/robustvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66686,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-18 + GenInt with Transfer","metrics":{"Top-1 Accuracy":"27.03","Top-5 Accuracy":"48.02"},"paper_url":"https://arxiv.org/abs/2012.12265v2","paper_title":"Generative Interventions for Causal Learning","paper_date":"2020-12-22","code_links":[{"title":"cvlab-columbia/GenInt","url":"https://github.com/cvlab-columbia/GenInt"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66687,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"MLP-Mixer","metrics":{"Top-1 Accuracy":"25.9"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66688,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RELICv2","metrics":{"Top-1 Accuracy":"25.9"},"paper_url":"https://arxiv.org/abs/2201.05119v2","paper_title":"Pushing the limits of self-supervised ResNets: Can we outperform supervised learning without labels on ImageNet?","paper_date":"2022-01-13","code_links":[{"title":"google-deepmind/relicv2","url":"https://github.com/google-deepmind/relicv2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66689,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT + MixUp","metrics":{"Top-1 Accuracy":"25.65"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66690,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"C-BYOL","metrics":{"Top-1 Accuracy":"25.5"},"paper_url":"https://arxiv.org/abs/2109.12909v3","paper_title":"Compressive Visual Representations","paper_date":"2021-09-27","code_links":[{"title":"google-research/compressive-visual-representations","url":"https://github.com/google-research/compressive-visual-representations"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66691,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"MLP-Mixer + Pixel","metrics":{"Top-1 Accuracy":"24.75"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66692,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"BYOL (BG_RM)","metrics":{"Top-1 Accuracy":"23.9"},"paper_url":"https://arxiv.org/abs/2103.12719v2","paper_title":"Characterizing and Improving the Robustness of Self-Supervised Learning through Background Augmentations","paper_date":"2021-03-23","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66693,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"RELIC","metrics":{"Top-1 Accuracy":"23.8"},"paper_url":"https://arxiv.org/abs/2201.05119v2","paper_title":"Pushing the limits of self-supervised ResNets: Can we outperform supervised learning without labels on ImageNet?","paper_date":"2022-01-13","code_links":[{"title":"google-deepmind/relicv2","url":"https://github.com/google-deepmind/relicv2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66694,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"BYOL","metrics":{"Top-1 Accuracy":"23"},"paper_url":"https://arxiv.org/abs/2201.05119v2","paper_title":"Pushing the limits of self-supervised ResNets: Can we outperform supervised learning without labels on ImageNet?","paper_date":"2022-01-13","code_links":[{"title":"google-deepmind/relicv2","url":"https://github.com/google-deepmind/relicv2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66695,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"SwAV (BG_RM)","metrics":{"Top-1 Accuracy":"21.9"},"paper_url":"https://arxiv.org/abs/2103.12719v2","paper_title":"Characterizing and Improving the Robustness of Self-Supervised Learning through Background Augmentations","paper_date":"2021-03-23","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66696,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT + CutMix","metrics":{"Top-1 Accuracy":"21.61"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66697,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"MoCo-v2 (BG_Swaps)","metrics":{"Top-1 Accuracy":"20.8"},"paper_url":"https://arxiv.org/abs/2103.12719v2","paper_title":"Characterizing and Improving the Robustness of Self-Supervised Learning through Background Augmentations","paper_date":"2021-03-23","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66698,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"C-SimCLR","metrics":{"Top-1 Accuracy":"20.8"},"paper_url":"https://arxiv.org/abs/2109.12909v3","paper_title":"Compressive Visual Representations","paper_date":"2021-09-27","code_links":[{"title":"google-research/compressive-visual-representations","url":"https://github.com/google-research/compressive-visual-representations"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66699,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"SeLa(v2) (reverse linear probing)","metrics":{"Top-1 Accuracy":"20.61","Top-5 Accuracy":"48.83"},"paper_url":"https://openreview.net/forum?id=HFPTzdwN39","paper_title":"Measuring the Interpretability of Unsupervised Representations via Quantized Reversed Probing","paper_date":"2021-09-29","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66700,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"DILEMMA","metrics":{"Top-1 Accuracy":"20.51"},"paper_url":"https://arxiv.org/abs/2204.04788v2","paper_title":"Representation Learning by Detecting Incorrect Location Embeddings","paper_date":"2022-04-10","code_links":[{"title":"separius/dilemma","url":"https://github.com/separius/dilemma"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66701,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"DeepCluster(v2) (reverse linear probing)","metrics":{"Top-1 Accuracy":"19.73","Top-5 Accuracy":"46.81"},"paper_url":"https://openreview.net/forum?id=HFPTzdwN39","paper_title":"Measuring the Interpretability of Unsupervised Representations via Quantized Reversed Probing","paper_date":"2021-09-29","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66702,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"VGG-14","metrics":{"Top-1 Accuracy":"19.13","Top-5 Accuracy":"37.15"},"paper_url":"http://papers.nips.cc/paper/9142-objectnet-a-large-scale-bias-controlled-dataset-for-pushing-the-limits-of-object-recognition-models","paper_title":"ObjectNet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","paper_date":"2019-12-01","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66703,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-50 (ImageNet-Captions)","metrics":{"Top-1 Accuracy":"18.70"},"paper_url":"https://arxiv.org/abs/2205.01397v2","paper_title":"Data Determines Distributional Robustness in Contrastive Language Image Pre-training (CLIP)","paper_date":"2022-05-03","code_links":[{"title":"mlfoundations/imagenet-captions","url":"https://github.com/mlfoundations/imagenet-captions"},{"title":"filipbasara0/simple-clip","url":"https://github.com/filipbasara0/simple-clip"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66704,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"SwAV (reverse linear probing)","metrics":{"Top-1 Accuracy":"17.71","Top-5 Accuracy":"43.64"},"paper_url":"https://openreview.net/forum?id=HFPTzdwN39","paper_title":"Measuring the Interpretability of Unsupervised Representations via Quantized Reversed Probing","paper_date":"2021-09-29","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66705,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT","metrics":{"Top-1 Accuracy":"17.36"},"paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","paper_date":"2021-11-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66706,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet34-RPG","metrics":{"Top-1 Accuracy":"16.5"},"paper_url":"https://arxiv.org/abs/2107.07110v3","paper_title":"Compact and Optimal Deep Learning with Recurrent Parameter Generators","paper_date":"2021-07-15","code_links":[{"title":"samaonline/Recurrent-Parameter-Generators","url":"https://github.com/samaonline/Recurrent-Parameter-Generators"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66707,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"CLIP (CC12M pretrain)","metrics":{"Top-1 Accuracy":"15.24"},"paper_url":"https://arxiv.org/abs/2204.04588v1","paper_title":"Robust Cross-Modal Representation Learning with Progressive Self-Distillation","paper_date":"2022-04-10","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66708,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"SimCLR","metrics":{"Top-1 Accuracy":"14.6"},"paper_url":"https://arxiv.org/abs/2201.05119v2","paper_title":"Pushing the limits of self-supervised ResNets: Can we outperform supervised learning without labels on ImageNet?","paper_date":"2022-01-13","code_links":[{"title":"google-deepmind/relicv2","url":"https://github.com/google-deepmind/relicv2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66709,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ResNet-152 (FRCNN-ag-ad, VOC)","metrics":{"Top-1 Accuracy":"13.2","Top-5 Accuracy":"29.7"},"paper_url":"https://arxiv.org/abs/2011.14204v1","paper_title":"Class-agnostic Object Detection","paper_date":"2020-11-28","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66710,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"MoCo(v2) (reverse linear probing)","metrics":{"Top-1 Accuracy":"12.67","Top-5 Accuracy":"31.45"},"paper_url":"https://openreview.net/forum?id=HFPTzdwN39","paper_title":"Measuring the Interpretability of Unsupervised Representations via Quantized Reversed Probing","paper_date":"2021-09-29","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66711,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"MoCHi  (reverse linear probing)","metrics":{"Top-1 Accuracy":"12.64","Top-5 Accuracy":"31.71"},"paper_url":"https://openreview.net/forum?id=HFPTzdwN39","paper_title":"Measuring the Interpretability of Unsupervised Representations via Quantized Reversed Probing","paper_date":"2021-09-29","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66712,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"OBoW (reverse linear probing)","metrics":{"Top-1 Accuracy":"12.23","Top-5 Accuracy":"31.72"},"paper_url":"https://openreview.net/forum?id=HFPTzdwN39","paper_title":"Measuring the Interpretability of Unsupervised Representations via Quantized Reversed Probing","paper_date":"2021-09-29","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66713,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"AlexNet","metrics":{"Top-1 Accuracy":"6.78","Top-5 Accuracy":"17.6"},"paper_url":"http://papers.nips.cc/paper/9142-objectnet-a-large-scale-bias-controlled-dataset-for-pushing-the-limits-of-object-recognition-models","paper_title":"ObjectNet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","paper_date":"2019-12-01","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66714,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"BigBiGAN (RevNet-50 4×)","metrics":{"Top-1 Accuracy":"4.92"},"paper_url":"https://arxiv.org/abs/2008.10312v2","paper_title":"Self-Supervised Learning for Large-Scale Unsupervised Image Clustering","paper_date":"2020-08-24","code_links":[{"title":"Randl/kmeans_selfsuper","url":"https://github.com/Randl/kmeans_selfsuper"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]},{"id":66715,"task":"Image Classification","parent_task":null,"dataset":"ObjectNet","model_name":"ViT-H/14","metrics":{"Top-5 Accuracy":"82.1"},"paper_url":"https://arxiv.org/abs/2010.11929v2","paper_title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","paper_date":"2020-10-22","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"labmlai/annotated_deep_learning_paper_implementations","url":"https://github.com/labmlai/annotated_deep_learning_paper_implementations"},{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"lucidrains/vit-pytorch","url":"https://github.com/lucidrains/vit-pytorch"},{"title":"pytorch/vision","url":"https://github.com/pytorch/vision/blob/main/torchvision/models/vision_transformer.py"},{"title":"lukas-blecher/LaTeX-OCR","url":"https://github.com/lukas-blecher/LaTeX-OCR"},{"title":"google-research/vision_transformer","url":"https://github.com/google-research/vision_transformer"},{"title":"kornia/kornia","url":"https://github.com/kornia/kornia"},{"title":"PaddlePaddle/PaddleClas","url":"https://github.com/PaddlePaddle/PaddleClas"},{"title":"open-mmlab/mmclassification","url":"https://github.com/open-mmlab/mmclassification"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/vissl","url":"https://github.com/facebookresearch/vissl"},{"title":"keras-team/keras-io","url":"https://github.com/keras-team/keras-io/blob/master/examples/vision/image_classification_with_vision_transformer.py"},{"title":"jeonsworld/ViT-pytorch","url":"https://github.com/jeonsworld/ViT-pytorch"},{"title":"alibaba/EasyCV","url":"https://github.com/alibaba/EasyCV"},{"title":"facebookresearch/ClassyVision","url":"https://github.com/facebookresearch/ClassyVision/tree/master/examples/vit"},{"title":"davisking/dlib-models","url":"https://github.com/davisking/dlib-models"},{"title":"BR-IDL/PaddleViT","url":"https://github.com/BR-IDL/PaddleViT/blob/main/image_classification/ViT"},{"title":"kakaobrain/coyo-dataset","url":"https://github.com/kakaobrain/coyo-dataset"},{"title":"The-AI-Summer/self_attention","url":"https://github.com/The-AI-Summer/self_attention"},{"title":"facebookresearch/hiera","url":"https://github.com/facebookresearch/hiera"},{"title":"jacobgil/vit-explain","url":"https://github.com/jacobgil/vit-explain"},{"title":"OML-Team/open-metric-learning","url":"https://github.com/OML-Team/open-metric-learning"},{"title":"lukemelas/PyTorch-Pretrained-ViT","url":"https://github.com/lukemelas/PyTorch-Pretrained-ViT"},{"title":"keras-team/keras-cv","url":"https://github.com/keras-team/keras-cv/blob/master/keras_cv/models/vit.py"},{"title":"Westlake-AI/openmixup","url":"https://github.com/Westlake-AI/openmixup"},{"title":"mahmoodlab/hipt","url":"https://github.com/mahmoodlab/hipt"},{"title":"SHI-Labs/Compact-Transformers","url":"https://github.com/SHI-Labs/Compact-Transformers"},{"title":"wangguanan/light-reid","url":"https://github.com/wangguanan/light-reid"},{"title":"TACJu/TransFG","url":"https://github.com/TACJu/TransFG"},{"title":"nasa-impact/hls-foundation-os","url":"https://github.com/nasa-impact/hls-foundation-os"},{"title":"mindspore-ai/models","url":"https://github.com/mindspore-ai/models/blob/master/research/cv/vit_base/"},{"title":"asyml/vision-transformer-pytorch","url":"https://github.com/asyml/vision-transformer-pytorch"},{"title":"haiyang-w/git","url":"https://github.com/haiyang-w/git"},{"title":"faustomorales/vit-keras","url":"https://github.com/faustomorales/vit-keras"},{"title":"jankrepl/mildlyoverfitted","url":"https://github.com/jankrepl/mildlyoverfitted"},{"title":"gupta-abhay/ViT","url":"https://github.com/gupta-abhay/ViT"},{"title":"martinsbruveris/tensorflow-image-models","url":"https://github.com/martinsbruveris/tensorflow-image-models"},{"title":"staghado/vit.cpp","url":"https://github.com/staghado/vit.cpp"},{"title":"PaddlePaddle/PASSL","url":"https://github.com/PaddlePaddle/PASSL"},{"title":"mindspore-ecosystem/mindcv","url":"https://github.com/mindspore-ecosystem/mindcv/blob/main/mindcv/models/vit.py"},{"title":"BrianPulfer/PapersReimplementations","url":"https://github.com/BrianPulfer/PapersReimplementations"},{"title":"mindspore-ai/models","url":"https://github.com/mindspore-ai/models/tree/master/official/cv/vit"},{"title":"emla2805/vision-transformer","url":"https://github.com/emla2805/vision-transformer"},{"title":"Kevinz-code/CSRA","url":"https://github.com/Kevinz-code/CSRA"},{"title":"Mayurji/Image-Classification-PyTorch","url":"https://github.com/Mayurji/Image-Classification-PyTorch"},{"title":"tintn/vision-transformer-from-scratch","url":"https://github.com/tintn/vision-transformer-from-scratch"},{"title":"SforAiDl/vformer","url":"https://github.com/SforAiDl/vformer"},{"title":"PaddlePaddle/PLSC","url":"https://github.com/PaddlePaddle/PLSC/tree/master/task/classification/vit"},{"title":"s-chh/pytorch-scratch-vision-transformer-vit","url":"https://github.com/s-chh/pytorch-scratch-vision-transformer-vit"},{"title":"junyongyou/triq","url":"https://github.com/junyongyou/triq"},{"title":"ra1ph2/Vision-Transformer","url":"https://github.com/ra1ph2/Vision-Transformer"},{"title":"asarigun/TransGAN","url":"https://github.com/asarigun/TransGAN"},{"title":"ashishpatel26/Vision-Transformer-Keras-Tensorflow-Pytorch-Examples","url":"https://github.com/ashishpatel26/Vision-Transformer-Keras-Tensorflow-Pytorch-Examples"},{"title":"kamalkraj/Vision-Transformer","url":"https://github.com/kamalkraj/Vision-Transformer"},{"title":"tuvovan/Vision_Transformer_Keras","url":"https://github.com/tuvovan/Vision_Transformer_Keras"},{"title":"tahmid0007/VisionTransformer","url":"https://github.com/tahmid0007/VisionTransformer"},{"title":"KatherLab/HIA","url":"https://github.com/KatherLab/HIA"},{"title":"naver-ai/pflayer","url":"https://github.com/naver-ai/pflayer"},{"title":"purbayankar/Hyperspectral-Vision-Transformer","url":"https://github.com/purbayankar/Hyperspectral-Vision-Transformer"},{"title":"UdbhavPrasad072300/Transformer-Implementations","url":"https://github.com/UdbhavPrasad072300/Transformer-Implementations"},{"title":"UdbhavPrasad072300/Transformer-Implementation-and-Language-Translation","url":"https://github.com/UdbhavPrasad072300/Transformer-Implementation-and-Language-Translation"},{"title":"UdbhavPrasad072300/Transformer-Implementation","url":"https://github.com/UdbhavPrasad072300/Transformer-Implementation"},{"title":"jiangtaoxie/So-ViT","url":"https://github.com/jiangtaoxie/So-ViT"},{"title":"james77777778/keras-image-models","url":"https://github.com/james77777778/keras-image-models"},{"title":"mashaan14/VisionTransformer-MNIST","url":"https://github.com/mashaan14/VisionTransformer-MNIST"},{"title":"BebDong/MXNetSeg","url":"https://github.com/BebDong/MXNetSeg"},{"title":"DavidLandup0/deepvision","url":"https://github.com/DavidLandup0/deepvision"},{"title":"DominikBatic/EndoViT","url":"https://github.com/DominikBatic/EndoViT"},{"title":"HzcIrving/DeepLearning_PlayGround","url":"https://github.com/HzcIrving/DeepLearning_PlayGround/tree/main/VIT"},{"title":"ruiqirichard/eegeyenet-vit","url":"https://github.com/ruiqirichard/eegeyenet-vit"},{"title":"megvii-research/basecls","url":"https://github.com/megvii-research/basecls/tree/main/zoo/public/vit"},{"title":"04RR/SOTA-Vision","url":"https://github.com/04RR/SOTA-Vision"},{"title":"protonx-engineering/vit","url":"https://github.com/protonx-engineering/vit"},{"title":"TheTensorDude/vision_transformer_tf","url":"https://github.com/TheTensorDude/vision_transformer_tf"},{"title":"jaketae/mlp-mixer","url":"https://github.com/jaketae/mlp-mixer"},{"title":"uygarkurt/ViT-PyTorch","url":"https://github.com/uygarkurt/ViT-PyTorch"},{"title":"sliao-mi-luku/Galaxy-Zoo-Classification","url":"https://github.com/sliao-mi-luku/Galaxy-Zoo-Classification"},{"title":"soumik12345/Vision-Transformer","url":"https://github.com/soumik12345/Vision-Transformer"},{"title":"smitheric95/MoCoViT-PyTorch","url":"https://github.com/smitheric95/MoCoViT-PyTorch"},{"title":"affjljoo3581/deit3-jax","url":"https://github.com/affjljoo3581/deit3-jax"},{"title":"uzi0espil/research-papers-implementation","url":"https://github.com/uzi0espil/research-papers-implementation/tree/master/Vision%20Transformer"},{"title":"mujiyantosvc/Facial-Expression-Recognition-FER-for-Mental-Health-Detection-","url":"https://github.com/mujiyantosvc/Facial-Expression-Recognition-FER-for-Mental-Health-Detection-"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"},{"title":"leemsaebom/attention-guided-cam-visual-explanations-of-vision-transformer-guided-by-self-attention","url":"https://github.com/leemsaebom/attention-guided-cam-visual-explanations-of-vision-transformer-guided-by-self-attention"},{"title":"quanmario0311/ViT_PyTorch","url":"https://github.com/quanmario0311/ViT_PyTorch"},{"title":"explainingai-code/VIT-Pytorch","url":"https://github.com/explainingai-code/VIT-Pytorch"},{"title":"jo1jun/Vision_Transformer","url":"https://github.com/jo1jun/Vision_Transformer"},{"title":"xiuyu0000/new_papers_codes","url":"https://github.com/xiuyu0000/new_papers_codes/tree/main/vit"},{"title":"smu-ivpl/DeepfakeDetection","url":"https://github.com/smu-ivpl/DeepfakeDetection"},{"title":"tw-yuhsi/a-new-perspective-for-shuttlecock-hitting-event-detection","url":"https://github.com/tw-yuhsi/a-new-perspective-for-shuttlecock-hitting-event-detection"},{"title":"wish44165/A-New-Perspective-for-Shuttlecock-Hitting-Event-Detection","url":"https://github.com/wish44165/A-New-Perspective-for-Shuttlecock-Hitting-Event-Detection"},{"title":"sayannath/ViT-Image-Classification","url":"https://github.com/sayannath/ViT-Image-Classification"},{"title":"YousefGamal220/Vision-Transformers","url":"https://github.com/YousefGamal220/Vision-Transformers"},{"title":"gmum/dl-mo-2021","url":"https://github.com/gmum/dl-mo-2021"},{"title":"nachiket273/Vision_transformer_pytorch","url":"https://github.com/nachiket273/Vision_transformer_pytorch"},{"title":"Abdulrahman-Adel/Real-Life-Violence-Detection","url":"https://github.com/Abdulrahman-Adel/Real-Life-Violence-Detection"},{"title":"septmars/DL","url":"https://github.com/septmars/DL"},{"title":"mtancak/PyTorch-ViT-Visual-Transformer","url":"https://github.com/mtancak/PyTorch-ViT-Visual-Transformer"},{"title":"zer0sh0t/artificial_intelligence","url":"https://github.com/zer0sh0t/artificial_intelligence/tree/master/vision_models/vision_transformer"},{"title":"mtancak1/PyTorch-ViT-Visual-Transformer","url":"https://github.com/mtancak1/PyTorch-ViT-Visual-Transformer"},{"title":"IMvision12/keras-vision-models","url":"https://github.com/IMvision12/keras-vision-models"},{"title":"xiuyu0000/papers_with_examples","url":"https://github.com/xiuyu0000/papers_with_examples/tree/main/ViT"},{"title":"sneakatyou/ViT-Tensorflow-2.0","url":"https://github.com/sneakatyou/ViT-Tensorflow-2.0"},{"title":"arkel23/PyTorch-Pretrained-ViT","url":"https://github.com/arkel23/PyTorch-Pretrained-ViT"},{"title":"woctezuma/steam-CLIP","url":"https://github.com/woctezuma/steam-CLIP"},{"title":"stevenwalton/scs-cct","url":"https://github.com/stevenwalton/scs-cct"},{"title":"Ugenteraan/Masked-AutoEncoder-PyTorch","url":"https://github.com/Ugenteraan/Masked-AutoEncoder-PyTorch"},{"title":"nateraw/lightning-vision-transformer","url":"https://github.com/nateraw/lightning-vision-transformer"},{"title":"seujung/pytorch-vit","url":"https://github.com/seujung/pytorch-vit"},{"title":"avinash31d/paper-implementations","url":"https://github.com/avinash31d/paper-implementations/tree/main/vit"},{"title":"Oguzhanercan/Vision-Transformers","url":"https://github.com/Oguzhanercan/Vision-Transformers"},{"title":"skchen1993/TrangFG","url":"https://github.com/skchen1993/TrangFG"},{"title":"holdfire/FAS","url":"https://github.com/holdfire/FAS"},{"title":"dispink/xpt","url":"https://github.com/dispink/xpt"},{"title":"holdfire/CLS","url":"https://github.com/holdfire/CLS"},{"title":"AlifAshrafee/ViT-pytorch-for-Cooking-State-Recognition","url":"https://github.com/AlifAshrafee/ViT-pytorch-for-Cooking-State-Recognition"},{"title":"sangHa0411/VIT","url":"https://github.com/sangHa0411/VIT"},{"title":"zpc-666/Paddle-R-Drop","url":"https://github.com/zpc-666/Paddle-R-Drop"},{"title":"Burf/VisionTransformer-Tensorflow2","url":"https://github.com/Burf/VisionTransformer-Tensorflow2"},{"title":"gnoses/ViT_examples","url":"https://github.com/gnoses/ViT_examples"},{"title":"Ugenteraan/Vanilla-ViT","url":"https://github.com/Ugenteraan/Vanilla-ViT"},{"title":"HyeonhoonLee/MAIC2021_Sleep","url":"https://github.com/HyeonhoonLee/MAIC2021_Sleep"},{"title":"ttt496/VisionTransformer","url":"https://github.com/ttt496/VisionTransformer"},{"title":"innat/LearnedResizer-Vision-Transformer","url":"https://github.com/innat/LearnedResizer-Vision-Transformer"},{"title":"Thanusan19/Vision_Transformer","url":"https://github.com/Thanusan19/Vision_Transformer"},{"title":"KiUngSong/Vision","url":"https://github.com/KiUngSong/Vision"},{"title":"liuxingwt/CLS","url":"https://github.com/liuxingwt/CLS"},{"title":"konstantinos-p/image_classification_SOTA","url":"https://github.com/konstantinos-p/image_classification_SOTA"},{"title":"qiaopTDUN/mae-repo","url":"https://github.com/qiaopTDUN/mae-repo"},{"title":"charchit7/Using_Transoformers","url":"https://github.com/charchit7/Using_Transoformers"},{"title":"kingcong/vit","url":"https://github.com/kingcong/vit"},{"title":"nachiket273/VisTrans","url":"https://github.com/nachiket273/VisTrans"},{"title":"alililia/vit_base_GPU","url":"https://github.com/alililia/vit_base_GPU"},{"title":"conceptofmind/ViT-haiku","url":"https://github.com/conceptofmind/ViT-haiku"},{"title":"SrinjaySarkar/ViT","url":"https://github.com/SrinjaySarkar/ViT"},{"title":"nima1999nikkhah/ViT-Hybrid","url":"https://github.com/nima1999nikkhah/ViT-Hybrid"},{"title":"shahrukhx01/ocr-test","url":"https://github.com/shahrukhx01/ocr-test"},{"title":"ahmed-alllam/Equinox","url":"https://github.com/ahmed-alllam/Equinox/blob/main/examples/vision_transformer.ipynb"},{"title":"ludics/ViT-Retri","url":"https://github.com/ludics/ViT-Retri"},{"title":"Mind23-2/MindCode-1","url":"https://github.com/Mind23-2/MindCode-1"},{"title":"Mind23-2/MindCode-89","url":"https://github.com/Mind23-2/MindCode-89"},{"title":"ZhouDaShan123/vit","url":"https://github.com/ZhouDaShan123/vit"},{"title":"rayanramoul/Visual-Transformer-PyTorch","url":"https://github.com/rayanramoul/Visual-Transformer-PyTorch"},{"title":"alililia/vit_base_Ascend","url":"https://github.com/alililia/vit_base_Ascend"},{"title":"gimme1dollar/vision-transformer","url":"https://github.com/gimme1dollar/vision-transformer"},{"title":"timH6502/VisionTransformer-PyTorch","url":"https://github.com/timH6502/VisionTransformer-PyTorch"},{"title":"modeeric/eegvit-tcnet","url":"https://github.com/modeeric/eegvit-tcnet"},{"title":"drumpt/ViT","url":"https://github.com/drumpt/ViT"},{"title":"BaiqiangGit/15minCode","url":"https://github.com/BaiqiangGit/15minCode"},{"title":"bshantam97/Attention_Based_Networks","url":"https://github.com/bshantam97/Attention_Based_Networks"},{"title":"YanYan0716/vision_transform","url":"https://github.com/YanYan0716/vision_transform"},{"title":"mdmhriday/vision-transformers","url":"https://github.com/mdmhriday/vision-transformers"},{"title":"SupreethRao99/VisionTransformer","url":"https://github.com/SupreethRao99/VisionTransformer"},{"title":"MindSpore-scientific/code-7","url":"https://github.com/MindSpore-scientific/code-7/tree/main/VisionTransformer"},{"title":"meowbutlerdev/ViT","url":"https://github.com/meowbutlerdev/ViT"},{"title":"Aedelon/ViT-PyTorch-Replication","url":"https://github.com/Aedelon/ViT-PyTorch-Replication"},{"title":"Julien-pour/music_classifcation","url":"https://github.com/Julien-pour/music_classifcation"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\"]","area":"Adversarial","uses_additional_data":1,"source":"archive","tags":[]}]}