HaVQA: A Dataset for Visual Question Answering and Multimodal Research in Hausa Language
This paper presents HaVQA, the first multimodal dataset for visual question-answering (VQA) tasks in the Hausa language. The dataset was created by manually translating 6,022 English question-answer pairs, which are associated with 1,555 unique images from the Visual Genome dataset. As a result, the dataset provides 12,044 gold standard English-Hausa parallel sentences that were translated in a fashion that guarantees their semantic match with the corresponding visual information. We conducted several baseline experiments on the dataset, including visual question answering, visual question elicitation, text-only and multimodal machine translation.
Code (1)
Tasks
Machine TranslationMultimodal Machine TranslationQuestion AnsweringTranslationVisual Question AnsweringVisual Question Answering (VQA)Similar Papers 제목 키워드 기반
MIMOQA: Multimodal Input Multimodal Output Question Answering
Multimodal research has picked up significantly in the space of question answering with the task being extended to visual question answering, charts question answering as well as multimodal input question answering. Howe…
Question AnsweringVisual Question AnsweringVisual Question Answering (VQA)Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding
Modeling textual or visual information with vector representations trained from large language or visual datasets has been successfully explored in recent years. However, tasks such as visual question answering require c…
Phrase GroundingVisual GroundingVisual Question AnsweringVisual Question Answering (VQA)Are You Smarter Than a Sixth Grader? Textbook Question Answering for Multimodal Machine Comprehension
We introduce the task of Multi-Modal Machine Comprehension (M3C), which aims at answering multimodal questions given a context of text, diagrams and images. We present the Textbook Question Answering (TQA) dataset that i…
Question AnsweringReading ComprehensionVisual Question AnsweringVisual Question Answering (VQA)A Dataset for Multimodal Question Answering in the Cultural Heritage Domain
Multimodal question answering in the cultural heritage domain allows visitors to ask questions in a more natural way and thus provides better user experiences with cultural objects while visiting a museum, landmark or an…
Question AnsweringSpeech RecognitionVisual Question Answering (VQA)LININ: Logic Integrated Neural Inference Network for Explanatory Visual Question Answering
Explanatory Visual Question Answering (EVQA) is a recently proposed multimodal reasoning task consisting of answering the visual question and generating multimodal explanations for the reasoning processes. Unlike traditi…
Explanatory Visual Question AnsweringMultimodal ReasoningQuestion AnsweringVisual Question Answering+1