{"task":"Zero-Shot Cross-Modal Retrieval","dataset":"Flickr30k","metric_names":["Image-to-text R@1","Image-to-text R@5","Image-to-text R@10","Text-to-image R@1","Text-to-image R@5","Text-to-image R@10"],"rows":[{"id":50467,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"InternVL-G","metrics":{"Image-to-text R@1":"95.7","Image-to-text R@10":"99.9","Image-to-text R@5":"99.7","Text-to-image R@1":"85.0","Text-to-image R@10":"98.6","Text-to-image R@5":"97.0"},"paper_url":"https://arxiv.org/abs/2312.14238v3","paper_title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","paper_date":"2023-12-21","code_links":[{"title":"opengvlab/internvl","url":"https://github.com/opengvlab/internvl"},{"title":"opengvlab/internvl-mmdetseg","url":"https://github.com/opengvlab/internvl-mmdetseg"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50468,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"BEiT-3","metrics":{"Image-to-text R@1":"94.9","Image-to-text R@10":"100.0","Image-to-text R@5":"99.9","Text-to-image R@1":"81.5","Text-to-image R@10":"97.8","Text-to-image R@5":"95.6"},"paper_url":"https://arxiv.org/abs/2208.10442v2","paper_title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","paper_date":"2022-08-22","code_links":[{"title":"microsoft/unilm","url":"https://github.com/microsoft/unilm/tree/master/beit"},{"title":"lyan62/data-curation","url":"https://github.com/lyan62/data-curation"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50469,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"InternVL-C","metrics":{"Image-to-text R@1":"94.7","Image-to-text R@10":"99.9","Image-to-text R@5":"99.6","Text-to-image R@1":"81.7","Text-to-image R@10":"98.2","Text-to-image R@5":"96.0"},"paper_url":"https://arxiv.org/abs/2312.14238v3","paper_title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","paper_date":"2023-12-21","code_links":[{"title":"opengvlab/internvl","url":"https://github.com/opengvlab/internvl"},{"title":"opengvlab/internvl-mmdetseg","url":"https://github.com/opengvlab/internvl-mmdetseg"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50470,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"COSMOS ViT-B/16","metrics":{"Image-to-text R@1":"92.9","Image-to-text R@10":"99.9","Image-to-text R@5":"99.4","Text-to-image R@1":"80.3","Text-to-image R@10":"97.6","Text-to-image R@5":"95.3"},"paper_url":"https://arxiv.org/abs/2412.01814v2","paper_title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","paper_date":"2024-12-02","code_links":[{"title":"ExplainableML/cosmos","url":"https://github.com/ExplainableML/cosmos"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50471,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"CoCa","metrics":{"Image-to-text R@1":"92.5","Image-to-text R@10":"99.9","Image-to-text R@5":"99.5","Text-to-image R@1":"80.4","Text-to-image R@10":"97.7","Text-to-image R@5":"95.7"},"paper_url":"https://arxiv.org/abs/2205.01917v2","paper_title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","paper_date":"2022-05-04","code_links":[{"title":"mlfoundations/open_clip","url":"https://github.com/mlfoundations/open_clip"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"lucidrains/CoCa-pytorch","url":"https://github.com/lucidrains/CoCa-pytorch"},{"title":"amitakamath/whatsup_vlms","url":"https://github.com/amitakamath/whatsup_vlms"},{"title":"amitakamath/hard_positives","url":"https://github.com/amitakamath/hard_positives"},{"title":"Chaolei98/FreeZAD","url":"https://github.com/Chaolei98/FreeZAD"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50472,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"RO-ViT","metrics":{"Image-to-text R@1":"92.1","Image-to-text R@10":"99.7","Image-to-text R@5":"99.4","Text-to-image R@1":"80.7","Text-to-image R@10":"97.7","Text-to-image R@5":"96.1"},"paper_url":"https://arxiv.org/abs/2305.07011v4","paper_title":"Region-Aware Pretraining for Open-Vocabulary Object Detection with Vision Transformers","paper_date":"2023-05-11","code_links":[{"title":"google-research/google-research","url":"https://github.com/google-research/google-research/tree/master/fvlm/rovit"},{"title":"mcahny/rovit","url":"https://github.com/mcahny/rovit"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50473,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"M2-Encoder","metrics":{"Image-to-text R@1":"91.2","Image-to-text R@10":"99.6","Image-to-text R@5":"99.2","Text-to-image R@1":"92.2","Text-to-image R@10":"99.7","Text-to-image R@5":"99.5"},"paper_url":"https://arxiv.org/abs/2401.15896v2","paper_title":"M2-Encoder: Advancing Bilingual Image-Text Understanding by Large-scale Efficient Pretraining","paper_date":"2024-01-29","code_links":[{"title":"alipay/Ant-Multi-Modal-Framework","url":"https://github.com/alipay/Ant-Multi-Modal-Framework/tree/main/prj/M2_Encoder"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":1,"source":"archive","tags":[]},{"id":50474,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"ERNIE-ViL 2.0","metrics":{"Image-to-text R@1":"91.2","Image-to-text R@10":"99.8","Image-to-text R@5":"99.1","Text-to-image R@1":"77.4","Text-to-image R@10":"96.4","Text-to-image R@5":"93.8"},"paper_url":"https://arxiv.org/abs/2209.15270v1","paper_title":"ERNIE-ViL 2.0: Multi-view Contrastive Learning for Image-Text Pre-training","paper_date":"2022-09-30","code_links":[{"title":"PaddlePaddle/ERNIE","url":"https://github.com/PaddlePaddle/ERNIE"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50475,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"Florence","metrics":{"Image-to-text R@1":"90.9","Image-to-text R@10":"-","Image-to-text R@5":"99.1","Text-to-image R@1":"76.7","Text-to-image R@10":"-","Text-to-image R@5":"93.6"},"paper_url":"https://arxiv.org/abs/2111.11432v1","paper_title":"Florence: A New Foundation Model for Computer Vision","paper_date":"2021-11-22","code_links":[{"title":"microsoft/unicl","url":"https://github.com/microsoft/unicl"},{"title":"MindCode-4/code-3","url":"https://github.com/MindCode-4/code-3/tree/main/florence2"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50476,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"ALBEF","metrics":{"Image-to-text R@1":"90.5","Image-to-text R@10":"99.7","Image-to-text R@5":"98.8","Text-to-image R@1":"76.8","Text-to-image R@10":"96.7","Text-to-image R@5":"93.7"},"paper_url":"https://arxiv.org/abs/2107.07651v2","paper_title":"Align before Fuse: Vision and Language Representation Learning with Momentum Distillation","paper_date":"2021-07-16","code_links":[{"title":"salesforce/lavis","url":"https://github.com/salesforce/lavis"},{"title":"salesforce/ALBEF","url":"https://github.com/salesforce/ALBEF"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"amazon-research/mix-generation","url":"https://github.com/amazon-research/mix-generation"},{"title":"salesforce/pb-ovd","url":"https://github.com/salesforce/pb-ovd"},{"title":"yuliangcai2022/clumo","url":"https://github.com/yuliangcai2022/clumo"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50477,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"COSMOS ViT-B/32","metrics":{"Image-to-text R@1":"89.9","Image-to-text R@10":"99.3","Image-to-text R@5":"98.8","Text-to-image R@1":"76.1","Text-to-image R@10":"96.2","Text-to-image R@5":"92.8"},"paper_url":"https://arxiv.org/abs/2412.01814v2","paper_title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","paper_date":"2024-12-02","code_links":[{"title":"ExplainableML/cosmos","url":"https://github.com/ExplainableML/cosmos"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50478,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"Flamingo","metrics":{"Image-to-text R@1":"89.3","Image-to-text R@10":"99.7","Image-to-text R@5":"98.8","Text-to-image R@1":"79.5","Text-to-image R@10":"97.9","Text-to-image R@5":"95.3"},"paper_url":"https://arxiv.org/abs/2204.14198v2","paper_title":"Flamingo: a Visual Language Model for Few-Shot Learning","paper_date":"2022-04-29","code_links":[{"title":"mlfoundations/open_flamingo","url":"https://github.com/mlfoundations/open_flamingo"},{"title":"lucidrains/flamingo-pytorch","url":"https://github.com/lucidrains/flamingo-pytorch"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"doc-doc/NExT-OE","url":"https://github.com/doc-doc/NExT-OE"},{"title":"happen2me/cross-gnn","url":"https://github.com/happen2me/cross-gnn"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50479,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"VK-OOD","metrics":{"Image-to-text R@1":"89.0","Image-to-text R@10":"99.8","Image-to-text R@5":"99.2","Text-to-image R@1":"77.2","Text-to-image R@10":"98.2","Text-to-image R@5":"94.3"},"paper_url":"https://openreview.net/forum?id=jooPcatnVF","paper_title":"Implicit Differentiable Outlier Detection Enable Robust Deep Multimodal Analysis","paper_date":"2023-09-21","code_links":[{"title":"ellenzhuwang/implicit_vkood","url":"https://github.com/ellenzhuwang/implicit_vkood"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50480,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"ALIGN","metrics":{"Image-to-text R@1":"88.6","Image-to-text R@10":"99.7","Image-to-text R@5":"98.7","Text-to-image R@1":"75.7","Text-to-image R@10":"96.8","Text-to-image R@5":"93.8"},"paper_url":"https://arxiv.org/abs/2102.05918v2","paper_title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","paper_date":"2021-02-11","code_links":[{"title":"facebookresearch/metaclip","url":"https://github.com/facebookresearch/metaclip"},{"title":"kakaobrain/coyo-dataset","url":"https://github.com/kakaobrain/coyo-dataset"},{"title":"MicPie/clasp","url":"https://github.com/MicPie/clasp"},{"title":"willard-yuan/video-text-retrieval-papers","url":"https://github.com/willard-yuan/video-text-retrieval-papers"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/align"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50481,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"CLIP","metrics":{"Image-to-text R@1":"88.0","Image-to-text R@10":"99.4","Image-to-text R@5":"98.7","Text-to-image R@1":"68.7","Text-to-image R@10":"95.2","Text-to-image R@5":"90.6"},"paper_url":"https://arxiv.org/abs/2103.00020v1","paper_title":"Learning Transferable Visual Models From Natural Language Supervision","paper_date":"2021-02-26","code_links":[{"title":"openai/CLIP","url":"https://github.com/openai/CLIP"},{"title":"mlfoundations/open_clip","url":"https://github.com/mlfoundations/open_clip"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/vissl","url":"https://github.com/facebookresearch/vissl"},{"title":"alibaba/EasyNLP","url":"https://github.com/alibaba/EasyNLP"},{"title":"apple/ml-mobileclip","url":"https://github.com/apple/ml-mobileclip"},{"title":"OML-Team/open-metric-learning","url":"https://github.com/OML-Team/open-metric-learning"},{"title":"FreddeFrallan/Multilingual-CLIP","url":"https://github.com/FreddeFrallan/Multilingual-CLIP"},{"title":"eps696/aphantasia","url":"https://github.com/eps696/aphantasia"},{"title":"muzairkhattak/multimodal-prompt-learning","url":"https://github.com/muzairkhattak/multimodal-prompt-learning"},{"title":"moein-shariatnia/OpenAI-CLIP","url":"https://github.com/moein-shariatnia/OpenAI-CLIP"},{"title":"facebookresearch/brainmagick","url":"https://github.com/facebookresearch/brainmagick"},{"title":"PaddlePaddle/PASSL","url":"https://github.com/PaddlePaddle/PASSL/blob/main/docs/Train_CLIP_model.md"},{"title":"taited/clip-score","url":"https://github.com/taited/clip-score"},{"title":"azshue/TPT","url":"https://github.com/azshue/TPT"},{"title":"clip-italian/clip-italian","url":"https://github.com/clip-italian/clip-italian"},{"title":"dhansmair/flamingo-mini","url":"https://github.com/dhansmair/flamingo-mini"},{"title":"ylqi/count-anything","url":"https://github.com/ylqi/count-anything"},{"title":"ml-jku/cloob","url":"https://github.com/ml-jku/cloob"},{"title":"sberbank-ai/ru-clip","url":"https://github.com/sberbank-ai/ru-clip"},{"title":"ai-forever/ru-clip","url":"https://github.com/ai-forever/ru-clip"},{"title":"Kaushalya/medclip","url":"https://github.com/Kaushalya/medclip"},{"title":"ajayjain/vectorascent","url":"https://github.com/ajayjain/vectorascent"},{"title":"linjieli222/hero_video_feature_extractor","url":"https://github.com/linjieli222/hero_video_feature_extractor"},{"title":"borisdayma/clip-jax","url":"https://github.com/borisdayma/clip-jax"},{"title":"sajjjadayobi/CLIPfa","url":"https://github.com/sajjjadayobi/CLIPfa"},{"title":"mertyg/post-hoc-cbm","url":"https://github.com/mertyg/post-hoc-cbm"},{"title":"mlbio-epfl/turtle","url":"https://github.com/mlbio-epfl/turtle"},{"title":"rinnakk/japanese-clip","url":"https://github.com/rinnakk/japanese-clip"},{"title":"salesforce/pb-ovd","url":"https://github.com/salesforce/pb-ovd"},{"title":"facebookresearch/clip-rocket","url":"https://github.com/facebookresearch/clip-rocket"},{"title":"sincerass/mvlpt","url":"https://github.com/sincerass/mvlpt"},{"title":"ericyinyzy/vlattack","url":"https://github.com/ericyinyzy/vlattack"},{"title":"redcaps-dataset/redcaps-downloader","url":"https://github.com/redcaps-dataset/redcaps-downloader"},{"title":"bespontaneous/proteus-pytorch","url":"https://github.com/bespontaneous/proteus-pytorch"},{"title":"shunk031/simple-aesthetics-predictor","url":"https://github.com/shunk031/simple-aesthetics-predictor"},{"title":"giantseaweed/decree","url":"https://github.com/giantseaweed/decree"},{"title":"sithu31296/simple-object-tracking","url":"https://github.com/sithu31296/simple-object-tracking"},{"title":"Gahyeonkim09/AAPL","url":"https://github.com/Gahyeonkim09/AAPL"},{"title":"filipbasara0/simple-clip","url":"https://github.com/filipbasara0/simple-clip"},{"title":"michi-3000/eyeclip","url":"https://github.com/michi-3000/eyeclip"},{"title":"baskargroup/Arboretum","url":"https://github.com/baskargroup/Arboretum"},{"title":"baskargroup/biotrove","url":"https://github.com/baskargroup/biotrove"},{"title":"kynkaat/role-of-imagenet-classes-in-fid","url":"https://github.com/kynkaat/role-of-imagenet-classes-in-fid"},{"title":"SforAiDl/CountCLIP","url":"https://github.com/SforAiDl/CountCLIP"},{"title":"mainaksingha01/applenet","url":"https://github.com/mainaksingha01/applenet"},{"title":"zhangxu0963/npc","url":"https://github.com/zhangxu0963/npc"},{"title":"mainaksingha01/odg-clip","url":"https://github.com/mainaksingha01/odg-clip"},{"title":"jhaprince/multibully","url":"https://github.com/jhaprince/multibully"},{"title":"klemens-floege/oneprot","url":"https://github.com/klemens-floege/oneprot"},{"title":"leolee99/CLIP_ITM","url":"https://github.com/leolee99/CLIP_ITM"},{"title":"madrylab/pretraining-distribution-shift-robustness","url":"https://github.com/madrylab/pretraining-distribution-shift-robustness"},{"title":"AndresPMD/Clip_CMR","url":"https://github.com/AndresPMD/Clip_CMR"},{"title":"fastscience-ai/medflamingo","url":"https://github.com/fastscience-ai/medflamingo"},{"title":"buyeah1109/KEN","url":"https://github.com/buyeah1109/KEN"},{"title":"pseulki/rococo","url":"https://github.com/pseulki/rococo"},{"title":"shkarupa-alex/tfclip","url":"https://github.com/shkarupa-alex/tfclip"},{"title":"IMvision12/keras-vision-models","url":"https://github.com/IMvision12/keras-vision-models"},{"title":"brown-palm/ObjectPrompt","url":"https://github.com/brown-palm/ObjectPrompt"},{"title":"YvanG/VQGAN-CLIP","url":"https://github.com/YvanG/VQGAN-CLIP"},{"title":"ramanakshay/clip","url":"https://github.com/ramanakshay/clip"},{"title":"NYU-DICE-Lab/open_clip","url":"https://github.com/NYU-DICE-Lab/open_clip"},{"title":"shivammehta25/clip","url":"https://github.com/shivammehta25/clip"},{"title":"minhanh151/respro","url":"https://github.com/minhanh151/respro"},{"title":"nopperl/clip_arxiv_pmc","url":"https://github.com/nopperl/clip_arxiv_pmc"},{"title":"s-a-malik/multi-few","url":"https://github.com/s-a-malik/multi-few"},{"title":"prabhupad26/100daysofML","url":"https://github.com/prabhupad26/100daysofML"},{"title":"armaank/archlectures","url":"https://github.com/armaank/archlectures"},{"title":"minhanh151/pre","url":"https://github.com/minhanh151/pre"},{"title":"yuuun/clip_pytorch","url":"https://github.com/yuuun/clip_pytorch"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/clip"},{"title":"lunaproject22/rpa","url":"https://github.com/lunaproject22/rpa"},{"title":"fiabdu/Commonly-Interesting-Images","url":"https://github.com/fiabdu/Commonly-Interesting-Images"},{"title":"iejMac/ScriptWriter","url":"https://github.com/iejMac/ScriptWriter"},{"title":"ZackPashkin/text2cartoon-pytorch-CLIP","url":"https://github.com/ZackPashkin/text2cartoon-pytorch-CLIP"},{"title":"bruthyu/bpt-vlm","url":"https://github.com/bruthyu/bpt-vlm"},{"title":"buyeah1109/finc","url":"https://github.com/buyeah1109/finc"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/clip"},{"title":"eify/open_clip","url":"https://github.com/eify/open_clip"},{"title":"2023-MindSpore-4/Code12","url":"https://github.com/2023-MindSpore-4/Code12/tree/main/MindFormers/clip"},{"title":"a736875071/clip-vit-large-patch14","url":"https://github.com/a736875071/clip-vit-large-patch14"},{"title":"nahidalam/open_clip","url":"https://github.com/nahidalam/open_clip"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50482,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"PTP-BLIP (14M)","metrics":{"Image-to-text R@1":"87.1","Image-to-text R@10":"99.3","Image-to-text R@5":"98.4","Text-to-image R@1":"73.1","Text-to-image R@10":"94.8","Text-to-image R@5":"91.0"},"paper_url":"https://arxiv.org/abs/2212.09737v2","paper_title":"Position-guided Text Prompt for Vision-Language Pre-training","paper_date":"2022-12-19","code_links":[{"title":"sail-sg/ptp","url":"https://github.com/sail-sg/ptp"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50483,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"AltCLIP","metrics":{"Image-to-text R@1":"86","Image-to-text R@10":"99.1","Image-to-text R@5":"98","Text-to-image R@1":"72.5","Text-to-image R@10":"95.4","Text-to-image R@5":"91.6"},"paper_url":"https://arxiv.org/abs/2211.06679v2","paper_title":"AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities","paper_date":"2022-11-12","code_links":[{"title":"flagai-open/flagai","url":"https://github.com/flagai-open/flagai"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/altclip"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50484,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"UNITER","metrics":{"Image-to-text R@1":"80.7","Image-to-text R@10":"98.0","Image-to-text R@5":"95.7","Text-to-image R@1":"66.2","Text-to-image R@10":"92.9","Text-to-image R@5":"88.4"},"paper_url":"https://arxiv.org/abs/1909.11740v3","paper_title":"UNITER: UNiversal Image-TExt Representation Learning","paper_date":"2019-09-25","code_links":[{"title":"ChenRocks/UNITER","url":"https://github.com/ChenRocks/UNITER"},{"title":"YIKUAN8/Transformers-VQA","url":"https://github.com/YIKUAN8/Transformers-VQA"},{"title":"necla-ml/SNLI-VE","url":"https://github.com/necla-ml/SNLI-VE"},{"title":"lichengunc/pretrain-vl-data","url":"https://github.com/lichengunc/pretrain-vl-data"},{"title":"vladsandulescu/hatefulmemes","url":"https://github.com/vladsandulescu/hatefulmemes"},{"title":"xiaomin418/cfsum","url":"https://github.com/xiaomin418/cfsum"},{"title":"SDLZY/VCR_Align","url":"https://github.com/SDLZY/VCR_Align"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50485,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"ViLT-B/32","metrics":{"Image-to-text R@1":"73.2","Image-to-text R@10":"96.5","Image-to-text R@5":"93.6","Text-to-image R@1":"55","Text-to-image R@10":"89.8","Text-to-image R@5":"82.5"},"paper_url":"https://arxiv.org/abs/2102.03334v2","paper_title":"ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision","paper_date":"2021-02-05","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"dandelin/vilt","url":"https://github.com/dandelin/vilt"},{"title":"glamor-usc/climb","url":"https://github.com/glamor-usc/climb"},{"title":"guilk/vlc","url":"https://github.com/guilk/vlc"},{"title":"wglab/gestaltmml","url":"https://github.com/wglab/gestaltmml"},{"title":"wglab/gestaltmml-gestaltgpt","url":"https://github.com/wglab/gestaltmml-gestaltgpt"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50486,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"ImageBERT","metrics":{"Image-to-text R@1":"70.7","Image-to-text R@10":"94.0","Image-to-text R@5":"90.2","Text-to-image R@1":"54.3","Text-to-image R@10":"87.5","Text-to-image R@5":"79.6"},"paper_url":"https://arxiv.org/abs/2001.07966v2","paper_title":"ImageBERT: Cross-modal Pre-training with Large-scale Weak-supervised Image-Text Data","paper_date":"2020-01-22","code_links":[],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50487,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"OpenCLIP VIT-H/14","metrics":{"Image-to-text R@1":"-","Image-to-text R@10":"-","Image-to-text R@5":"99.3","Text-to-image R@1":"-","Text-to-image R@10":"-","Text-to-image R@5":"94.1"},"paper_url":"https://arxiv.org/abs/2212.07143v2","paper_title":"Reproducible scaling laws for contrastive language-image learning","paper_date":"2022-12-14","code_links":[{"title":"mlfoundations/open_clip","url":"https://github.com/mlfoundations/open_clip"},{"title":"laion-ai/scaling-laws-openclip","url":"https://github.com/laion-ai/scaling-laws-openclip"},{"title":"shkarupa-alex/tfclip","url":"https://github.com/shkarupa-alex/tfclip"},{"title":"nahidalam/open_clip","url":"https://github.com/nahidalam/open_clip"},{"title":"eify/open_clip","url":"https://github.com/eify/open_clip"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":0,"source":"archive","tags":[]},{"id":50488,"task":"Zero-Shot Cross-Modal Retrieval","parent_task":"Image Retrieval with Multi-Modal Query","dataset":"Flickr30k","model_name":"VAST","metrics":{"Text-to-image R@1":"90.4"},"paper_url":"https://arxiv.org/abs/2305.18500v2","paper_title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","paper_date":"2023-05-29","code_links":[{"title":"TXH-mercury/VALOR","url":"https://github.com/TXH-mercury/VALOR"},{"title":"txh-mercury/vast","url":"https://github.com/txh-mercury/vast"}],"metrics_order":"[\"Image-to-text R@1\", \"Image-to-text R@5\", \"Image-to-text R@10\", \"Text-to-image R@1\", \"Text-to-image R@5\", \"Text-to-image R@10\"]","area":"Miscellaneous","uses_additional_data":1,"source":"archive","tags":[]}]}