paper-with-me

홈 › Papers

Text-Aware Dual Routing Network for Visual Question Answering

2022-11-17 · Luoqian Jiang, Yifan He, Jian Chen

Visual question answering (VQA) is a challenging task to provide an accurate natural language answer given an image and a natural language question about the image. It involves multi-modal learning, i.e., computer vision (CV) and natural language processing (NLP), as well as flexible answer prediction for free-form and open-ended answers. Existing approaches often fail in cases that require reading and understanding text in images to answer questions. In practice, they cannot effectively handle the answer sequence derived from text tokens because the visual features are not text-oriented. To address the above issues, we propose a Text-Aware Dual Routing Network (TDR) which simultaneously handles the VQA cases with and without understanding text information in the input images. Specifically, we build a two-branch answer prediction network that contains a specific branch for each case and further develop a dual routing scheme to dynamically determine which branch should be chosen. In the branch that involves text understanding, we incorporate the Optical Character Recognition (OCR) features into the model to help understand the text in the images. Extensive experiments on the VQA v2.0 dataset demonstrate that our proposed TDR outperforms existing methods, especially on the ''number'' related VQA questions.

📄 PDF Abstract BibTeX arXiv:2211.14450

Code (0)

등록된 구현이 없습니다.

Tasks

Optical Character RecognitionOptical Character Recognition (OCR)Question AnsweringVisual Question AnsweringVisual Question Answering (VQA)

Methods 이 논문이 사용한 방법론

fail 설명 없음

Similar Papers 제목 키워드 기반

Question Guided Modular Routing Networks for Visual Question Answering

2019-04-17 · Yanze Wu, Qiang Sun, Jianqi Ma, Bin Li 외

This paper studies the task of Visual Question Answering (VQA), which is topical in Multimedia community recently. Particularly, we explore two critical research problems existed in VQA: (1) efficiently fusing the visual…

Question AnsweringVisual Question AnsweringVisual Question Answering (VQA)Visual Reasoning

GRACE: Grounded Reasoning via Adapter Composition and Evidence-Aware Calibration for Educational Visual Question Answering

2026-08-19 · Xinjin Li, Yudi Xia, Xi Zhao, Yiliu Xu 외 arxiv

Educational visual question answering, or VQA, requires models to solve curriculum-oriented multiple-choice questions using both language and visual evidence. Compared with conventional open-ended VQA, educational exampl…

Visual Question Answering

CoGR-MoE: Concept-Guided Expert Routing with Consistent Selection and Flexible Reasoning for Visual Question Answering

2026-04-18 · Xiyin Zeng, Yi Lu, Hao Wang arxiv

Visual Question Answering (VQA) requires models to identify the correct answer options based on both visual and textual evidence. Recent Mixture-of-Experts (MoE) methods improve option reasoning by grouping similar conce…

Visual Question AnsweringContrastive Learning

Semantic-aware Modular Capsule Routing for Visual Question Answering

2022-07-21 · Yudong Han, Jianhua Yin, Jianlong Wu, Yinwei Wei 외

Visual Question Answering (VQA) is fundamentally compositional in nature, and many questions are simply answered by decomposing them into modular sub-problems. The recent proposed Neural Module Network (NMN) employ this …

Question AnsweringVisual Question AnsweringVisual Question Answering (VQA)

SAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering

2026-06-17 · Ayush Dwivedi, Qixin Wang, Ashvi Soni, Ruoteng Wang 외 arxiv

Vision-language models (VLMs) are powerful for chart question answering, but invoking a VLM for every query can be unnecessarily expensive when many questions are answerable from OCR text and lightweight language reasoni…

Chart Question AnsweringVisual Grounding