Visual Question Answering 벤치마크
Visual Question Answering on COCO Visual Question Answering (VQA) real images 2.0 open ended
| Rank | Model | Percentage correct | Paper | Code | Year |
|---|---|---|---|---|---|
| 1 | MaMMUT (2B) | 80.7 | MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks | lucidrains/mammut-pytorch | 2023 |
| 1 | MaMMUT (2B) | 80.7 | MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks | lucidrains/mammut-pytorch | 2023 |