Visual Grounding 벤치마크
Visual Grounding on RefCOCO+ val
Accuracy (%)
- 2021-11-16 — X-VLM (base): Accuracy (%) 84.51
- 2022-11-22 — X2-VLM (large): Accuracy (%) 87.6
- 2023-02-01 — mPLUG-2: Accuracy (%) 90.33
- 2023-11-10 — Florence-2-large-ft: Accuracy (%) 93.4
| Rank | Model | Accuracy (%) | Extra Training Data | Paper | Code | Year |
|---|---|---|---|---|---|---|
| 1 | Florence-2-large-ft | 93.4 | ✓ | Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks | retkowsky/florence-2 | 2023 |
| 2 | mPLUG-2 | 90.33 | mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video | modelscope/modelscope · x-plug/mplug-owl · alibaba/AliceMind · +1 | 2023 | |
| 3 | X2-VLM (large) | 87.6 | X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks | zengyan-97/x-vlm · zengyan-97/x2-vlm | 2022 | |
| 4 | XFM (base) | 86.1 | Toward Building General Foundation Models for Language, Vision, and Vision-Language Understanding Tasks | zhangxinsong-nlp/XFM | 2023 | |
| 5 | X2-VLM (base) | 85.2 | X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks | zengyan-97/x-vlm · zengyan-97/x2-vlm | 2022 | |
| 6 | X-VLM (base) | 84.51 | Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts | zengyan-97/x-vlm | 2021 |