Visual Question Answering 벤치마크
Visual Question Answering on VQA v2
Accuracy
- 2023-07-11 — Emu-I *: Accuracy 57.5
- 2023-12-01 — RLHF-V: Accuracy 80.0
| Rank | Model | Accuracy | Paper | Code | Year |
|---|---|---|---|---|---|
| 1 | RLHF-V | 80 | RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback | openbmb/minicpm-v · rlhf-v/rlhf-v · tidedra/vl-rlhf · +1 | 2023 |
| 2 | Emu-I * | 57.5 | Emu: Generative Pretraining in Multimodality | baaivision/emu · doc-doc/NExT-OE | 2023 |
| 3 | RLHF-V | 80 | RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback | openbmb/minicpm-v · rlhf-v/rlhf-v · tidedra/vl-rlhf · +1 | 2023 |
| 4 | Emu-I * | 57.5 | Emu: Generative Pretraining in Multimodality | baaivision/emu · doc-doc/NExT-OE | 2023 |