paper-with-me

Visual Grounding 벤치마크

Visual Grounding on RefCOCO+ val

6개 결과 · ⬇ CSV · JSON

Accuracy (%)

84.51 86.73 88.96 91.18 93.4 2021-11 2026-09 X-VLM (base) — 84.51 (2021-11-16) X2-VLM (large) — 87.6 (2022-11-22) X2-VLM (base) — 85.2 (2022-11-22) XFM (base) — 86.1 (2023-01-12) mPLUG-2 — 90.33 (2023-02-01) Florence-2-large-ft — 93.4 (2023-11-10) X-VLM (base) — 84.51 (2021-11-16) X2-VLM (large) — 87.6 (2022-11-22) mPLUG-2 — 90.33 (2023-02-01) Florence-2-large-ft — 93.4 (2023-11-10)
RankModel Accuracy (%) Extra Training Data PaperCodeYear
1 Florence-2-large-ft 93.4 Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks retkowsky/florence-2 2023
2 mPLUG-2 90.33 mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video modelscope/modelscope · x-plug/mplug-owl · alibaba/AliceMind · +1 2023
3 X2-VLM (large) 87.6 X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks zengyan-97/x-vlm · zengyan-97/x2-vlm 2022
4 XFM (base) 86.1 Toward Building General Foundation Models for Language, Vision, and Vision-Language Understanding Tasks zhangxinsong-nlp/XFM 2023
5 X2-VLM (base) 85.2 X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks zengyan-97/x-vlm · zengyan-97/x2-vlm 2022
6 X-VLM (base) 84.51 Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts zengyan-97/x-vlm 2021
1–6 / 6 페이지당 10 20 50 100