paper-with-me

홈 › Papers

Knowledge Acquisition for Visual Question Answering via Iterative Querying

2017-07-01 · CVPR 2017 7 · Yuke Zhu, Joseph J. Lim, Li Fei-Fei

Humans possess an extraordinary ability to learn new skills and new knowledge for problem solving. Such learning ability is also required by an automatic model to deal with arbitrary, open-ended questions in the visual world. We propose a neural-based approach to acquiring task- driven information for visual question answering (VQA). Our model proposes queries to actively acquire relevant information from external auxiliary data. Supporting evidence from either human-curated or automatic sources is encoded and stored into a memory bank. We show that acquiring task-driven evidence effectively improves model performance on both the Visual7W and VQA datasets; moreover, these queries offer certain level of interpretability in our iterative QA model.

📄 PDF Abstract BibTeX

Code (0)

등록된 구현이 없습니다.

Tasks

Question AnsweringVisual Question AnsweringVisual Question Answering (VQA)

Methods 이 논문이 사용한 방법론

Interpretability 설명 없음

Similar Papers 제목 키워드 기반

Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models

2024-07-22 · Wenbin An, Feng Tian, Jiahao Nie, Wenkai Shi 외

Knowledge-based Visual Question Answering (KVQA) requires both image and world knowledge to answer questions. Current methods first retrieve knowledge from the image and external knowledge base with the original complex …

DisentanglementQuestion AnsweringVisual Question AnsweringWorld Knowledge

Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering

2025-08-31 · Changin Choi, Wonseok Lee, Jungmin Ko, Wonjong Rhee arxiv

Knowledge-intensive visual question answering (VQA) requires external knowledge beyond image content, demanding precise visual grounding and coherent integration of visual and textual information. Although multimodal ret…

Visual Question AnsweringVisual Grounding

A Knowledge Noise Mitigation Framework for Knowledge-based Visual Question Answering

2025-09-11 · Zhiyue Liu, Sihang Liu, Jinyuan Liu, Xinru Zhang arxiv

Knowledge-based visual question answering (KB-VQA) requires a model to understand images and utilize external knowledge to provide accurate answers. Existing approaches often directly augment models with retrieved inform…

Visual Question Answering

MacVQA: Adaptive Memory Allocation and Global Noise Filtering for Continual Visual Question Answering

2026-01-05 · Zhifei Li, Yiran Wang, Chenyi Xiong, Yujing Xia 외 arxiv

Visual Question Answering (VQA) requires models to reason over multimodal information, combining visual and textual data. With the development of continual learning, significant progress has been made in retaining knowle…

Visual Question AnsweringContinual Learning

Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation

2026-05-05 · Quanxing Xu, Ling Zhou, Xian Zhong, Xiaohua Huang 외 arxiv

With advances in multimodal research and deep learning, Multimodal Large Language Models (MLLMs) have emerged as a powerful paradigm for a wide range of multimodal tasks. As a core problem in vision-language research, Vi…

Visual Question Answering