paper-with-me

Visual Question Answering v2.0

VQA v2.0

홈페이지 · 논문 366편

Visual Question Answering (VQA) v2.0 is a dataset containing open-ended questions about images. These questions require an understanding of vision, language and commonsense knowledge to answer. It is the second version of the VQA dataset. - 265,016 images (COCO and abstract scenes) - At least 3 questions (5.4 questions on average) per image - 10 ground truth answers per question - 3 plausible (but likely incorrect) answers per question - Automatic evaluation metric The [first version of the dataset](/dataset/visual-question-answering) was released in October 2015.

ImagesTexts

벤치마크

Visual Question Answering (VQA) on VQA v2 test-dev 결과 56개
Visual Question Answering (VQA) on VQA v2 test-std 결과 38개
Visual Question Answering on VQA v2 test-dev 결과 22개
Visual Question Answering (VQA) on VQA v2 val 결과 11개
Visual Question Answering on VQA v2 val 결과 8개
Visual Question Answering on VQA v2 test-std 결과 6개
Visual Question Answering on VQA v2 결과 4개