paper-with-me

홈 › Papers

CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning

2016-12-20 · CVPR 2017 7 · Justin Johnson, Bharath Hariharan, Laurens van der Maaten, Li Fei-Fei, C. Lawrence Zitnick, Ross Girshick

When building artificial intelligence systems that can reason and answer questions about visual data, we need diagnostic tests to analyze our progress and discover shortcomings. Existing benchmarks for visual question answering can help, but have strong biases that models can exploit to correctly answer questions without reasoning. They also conflate multiple sources of error, making it hard to pinpoint model weaknesses. We present a diagnostic dataset that tests a range of visual reasoning abilities. It contains minimal biases and has detailed annotations describing the kind of reasoning each question requires. We use this dataset to analyze a variety of modern visual reasoning systems, providing novel insights into their abilities and limitations.

📄 PDF Abstract BibTeX arXiv:1612.06890

Code (5)

AlexKuhnle/film pytorch
Lucas2012/ProbabilisticNeuralProgrammedNetwork pytorch
ethanjperez/film pytorch
necla-ml/SNLI-VE
pliang279/multiviz pytorch

Tasks

DiagnosticQuestion AnsweringVisual Question AnsweringVisual Question Answering (VQA)Visual Reasoning

Similar Papers 제목 키워드 기반

QLEVR: A Diagnostic Dataset for Quantificational Language and Elementary Visual Reasoning

2022-05-06 · Findings (NAACL) 2022 7 · Zechen Li, Anders Søgaard

Synthetic datasets have successfully been used to probe visual question-answering datasets for their reasoning abilities. CLEVR (johnson2017clevr), for example, tests a range of visual reasoning abilities. The questions …

DiagnosticQuestion AnsweringVisual Question AnsweringVisual Question Answering (VQA)+1

CLEAR: A Dataset for Compositional Language and Elementary Acoustic Reasoning

2018-11-26 · Jerome Abdelnour, Giampiero Salvi, Jean Rouat

We introduce the task of acoustic question answering (AQA) in the area of acoustic reasoning. In this task an agent learns to answer questions on the basis of acoustic context. In order to promote research in this area, …

Acoustic Question AnsweringQuestion AnsweringVisual Question AnsweringVisual Question Answering (VQA)

ClevrSkills: Compositional Language and Visual Reasoning in Robotics

2024-11-13 · Sanjay Haresh, Daniel Dijkman, Apratim Bhattacharyya, Roland Memisevic

Robotics tasks are highly compositional by nature. For example, to perform a high-level task like cleaning the table a robot must employ low-level capabilities of moving the effectors to the objects on the table, pick th…

Visual Reasoning

CLEVR-Dialog: A Diagnostic Dataset for Multi-Round Reasoning in Visual Dialog

2019-03-07 · NAACL 2019 6 · Satwik Kottur, José M. F. Moura, Devi Parikh, Dhruv Batra 외

Visual Dialog is a multimodal task of answering a sequence of questions grounded in an image, using the conversation history as context. It entails challenges in vision, language, reasoning, and grounding. However, study…

coreference-resolutionCoreference ResolutionDiagnosticVisual Dialog

Iterated learning for emergent systematicity in VQA

2021-05-03 · ICLR 2021 1 · Ankit Vani, Max Schwarzer, Yuchen Lu, Eeshan Dhekane 외

Although neural module networks have an architectural bias towards compositionality, they require gold standard layouts to generalize systematically in practice. When instead learning layouts and modules jointly, composi…

Question AnsweringSystematic GeneralizationVisual Question AnsweringVisual Question Answering (VQA)