paper-with-me

Cross-Modal Retrieval 벤치마크

Cross-Modal Retrieval on Flickr30k

82개 결과 · ⬇ CSV · JSON

Image-to-text R@1

40.1 54.77 69.45 84.12 98.8 2017-07 2026-09 VSE++ (ResNet) — 52.9 (2017-07-18) VSE++ (ResNet) — 52.9 (2017-07-18) VSE++ (ResNet) — 52.9 (2017-07-18) Dual-Path (ResNet) — 55.6 (2017-11-15) Dual-Path (ResNet) — 55.6 (2017-11-15) Dual-Path (ResNet) — 55.6 (2017-11-15) SCO (ResNet) — 55.5 (2017-12-06) SCO (ResNet) — 55.5 (2017-12-06) SCO (ResNet) — 55.5 (2017-12-06) SCAN — 67.4 (2018-03-21) SCAN — 67.4 (2018-03-21) SCAN — 67.4 (2018-03-21) CMPL (ResNet) — 49.6 (2018-09-01) CMPL (ResNet) — 49.6 (2018-09-01) CMPL (ResNet) — 49.6 (2018-09-01) IMRAM — 74.1 (2020-03-08) IMRAM — 74.1 (2020-03-08) IMRAM — 74.1 (2020-03-08) GSMN — 76.4 (2020-04-01) GSMN — 76.4 (2020-04-01) GSMN — 76.4 (2020-04-01) SGRAF — 77.8 (2021-01-05) SGRAF — 77.8 (2021-01-05) SGRAF — 77.8 (2021-01-05) ViLT-B/32 — 83.5 (2021-02-05) ViLT-B/32 — 83.5 (2021-02-05) ViLT-B/32 — 83.5 (2021-02-05) ALIGN — 95.3 (2021-02-11) ALIGN — 95.3 (2021-02-11) ALIGN — 95.3 (2021-02-11) IAIS — 88.3 (2021-05-28) IAIS — 88.3 (2021-05-28) IAIS — 88.3 (2021-05-28) X-VLM (base) — 97.1 (2021-11-16) X-VLM (base) — 97.1 (2021-11-16) X-VLM (base) — 97.1 (2021-11-16) ViSTA — 89.5 (2022-03-31) ViSTA — 89.5 (2022-03-31) ViSTA — 89.5 (2022-03-31) BEiT-3 — 98.0 (2022-08-22) BEiT-3 — 98.0 (2022-08-22) BEiT-3 — 98.0 (2022-08-22) OmniVL (14M) — 97.3 (2022-09-15) OmniVL (14M) — 97.3 (2022-09-15) OmniVL (14M) — 97.3 (2022-09-15) ERNIE-ViL 2.0 — 97.2 (2022-09-30) ERNIE-ViL 2.0 — 97.2 (2022-09-30) ERNIE-ViL 2.0 — 97.2 (2022-09-30) VSE-Gradient — 97.0 (2022-10-21) VSE-Gradient — 97.0 (2022-10-21) VSE-Gradient — 97.0 (2022-10-21) X2-VLM (large) — 98.8 (2022-11-22) X2-VLM (base) — 98.5 (2022-11-22) X2-VLM (large) — 98.8 (2022-11-22) X2-VLM (base) — 98.5 (2022-11-22) X2-VLM (large) — 98.8 (2022-11-22) X2-VLM (base) — 98.5 (2022-11-22) NAPReg — 79.6 (2023-01-07) NAPReg — 79.6 (2023-01-07) NAPReg — 79.6 (2023-01-07) RCAR — 82.3 (2023-03-23) RCAR — 82.3 (2023-03-23) RCAR — 82.3 (2023-03-23) DSMD — 82.5 (2024-04-16) DSMD — 82.5 (2024-04-16) DSMD — 82.5 (2024-04-16) 3SHNet — 87.1 (2024-04-26) 3SHNet — 87.1 (2024-04-26) 3SHNet — 87.1 (2024-04-26) OS-HGAdapter — 40.1 (2025-10-15) VSE++ (ResNet) — 52.9 (2017-07-18) Dual-Path (ResNet) — 55.6 (2017-11-15) SCAN — 67.4 (2018-03-21) IMRAM — 74.1 (2020-03-08) GSMN — 76.4 (2020-04-01) SGRAF — 77.8 (2021-01-05) ViLT-B/32 — 83.5 (2021-02-05) ALIGN — 95.3 (2021-02-11) X-VLM (base) — 97.1 (2021-11-16) BEiT-3 — 98.0 (2022-08-22) X2-VLM (large) — 98.8 (2022-11-22)
RankModel Image-to-text R@1Image-to-text R@5Image-to-text R@10Text-to-image R@1Text-to-image R@5Text-to-image R@10 Extra Training Data PaperCodeYear
1 X2-VLM (large) 98.810010091.898.699.5 X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks zengyan-97/x-vlm · zengyan-97/x2-vlm 2022
2 X2-VLM (base) 98.510010090.498.299.3 X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks zengyan-97/x-vlm · zengyan-97/x2-vlm 2022
3 BEiT-3 98.0100.0100.090.398.799.5 Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks microsoft/unilm · lyan62/data-curation 2022
4 OmniVL (14M) 97.399.910087.997.899.1 OmniVL:One Foundation Model for Image-Language and Video-Language Tasks 2022
5 ERNIE-ViL 2.0 97.2100.0100.093.399.499.8 ERNIE-ViL 2.0: Multi-view Contrastive Learning for Image-Text Pre-training PaddlePaddle/ERNIE 2022
5 Aurora (ours, r=128) 97.210010086.897.698.9
7 X-VLM (base) 97.1100.0100.086.997.398.7 Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts zengyan-97/x-vlm 2021
8 VSE-Gradient 97.099.610086.397.499.0 Dissecting Deep Metric Learning Losses for Image-Text Retrieval microsoft/VSE_Gradient · littleredxh/vse-gradient 2022
9 ALIGN 95.399.810084.997.498.6 Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision facebookresearch/metaclip · kakaobrain/coyo-dataset · MicPie/clasp · +2 2021
10 ViSTA 89.598.499.675.894.296.9 ViSTA: Vision and Scene Text Aggregation for Cross-Modal Retrieval 2022
11 IAIS 88.398.499.476.8693.395.72 Learning Relation Alignment for Calibrated Cross-modal Retrieval lancopku/IAIS 2021
12 3SHNet 87.198.299.269.591.094.7 3SHNet: Boosting Image-Sentence Retrieval via Visual Semantic-Spatial Self-Highlighting xurige1995/3shnet 2024
13 ViLT-B/32 83.596.798.664.488.793.8 ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision huggingface/transformers · dandelin/vilt · glamor-usc/climb · +3 2021
14 DSMD 82.595.597.768.490.894.4 Dynamic Self-adaptive Multiscale Distillation from Pre-trained Multimodal Large Model for Efficient Cross-modal Representation Learning chrisx599/dsmd 2024
15 RCAR 82.396.098.462.685.891.1 Plug-and-Play Regulators for Image-Text Matching paranioar/rcar 2023
16 NAPReg 79.660.0 NAPReg: Nouns As Proxies Regularization for Semantically Aware Cross-Modal Embeddings bhavinjawade/NAPReq 2023
17 SGRAF 77.894.197.458.583.088.8 Similarity Reasoning and Filtration for Image-Text Matching Paranioar/SGRAF 2021
18 GSMN 76.494.397.357.482.389.0 Graph Structured Network for Image-Text Matching CrossmodalGroup/GSMN 2020
19 Pearl 75.393.497.354.9881.388.26
20 IMRAM 74.193.096.653.979.487.2 IMRAM: Iterative Matching with Recurrent Attention Memory for Cross-Modal Image-Text Retrieval HuiChen24/IMRAM 2020
1–20 / 82 다음 → 페이지당 10 20 50 100