paper-with-me

Papers

Multimodal Prompt Retrieval for Generative Visual Question Answering

2023-06-30 · Timothy Ossowski, Junjie Hu

Recent years have witnessed impressive results of pre-trained vision-language models on knowledge-intensive tasks such as visual question answering (VQA). Despite the recent advances in VQA, existing methods mainly adopt a discriminative formulation that predicts answers within a pre-defined label set, leading to easy overfitting on low-resource domains with limited labeled data (e.g., medicine) and poor generalization under domain shift to another dataset. To tackle this limitation, we propose a novel generative model enhanced by multimodal prompt retrieval (MPR) that integrates retrieved prompts and multimodal features to generate answers in free text. Our generative model enables rapid zero-shot dataset adaptation to unseen data distributions and open-set answer labels across datasets. Our experiments on medical VQA tasks show that MPR outperforms its non-retrieval counterpart by up to 30% accuracy points in a few-shot domain adaptation setting.

📄 PDF Abstract BibTeX arXiv:2306.17675

Code (1)

tossowski/multimodalpromptretrieval 공식 구현 pytorch

Tasks

Domain AdaptationGenerative Visual Question AnsweringQuestion AnsweringRetrievalVisual Question AnsweringVisual Question Answering (VQA)

Similar Papers 제목 키워드 기반

CREM: Compression-Driven Representation Enhancement for Multimodal Retrieval and Comprehension

2026-02-22 · Lihao Liu, Yan Wang, Biao Yang, Da Li 외 arxiv

Multimodal Large Language Models (MLLMs) have shown remarkable success in comprehension tasks such as visual description and visual question answering. However, their direct application to embedding-based tasks like retr…

Visual Question Answering

Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation

2026-05-05 · Quanxing Xu, Ling Zhou, Xian Zhong, Xiaohua Huang 외 arxiv

With advances in multimodal research and deep learning, Multimodal Large Language Models (MLLMs) have emerged as a powerful paradigm for a wide range of multimodal tasks. As a core problem in vision-language research, Vi…

Visual Question Answering

EchoSight: Advancing Visual-Language Models with Wiki Knowledge

2024-07-17 · Yibin Yan, Weidi Xie

Knowledge-based Visual Question Answering (KVQA) tasks require answering questions about images using extensive background knowledge. Despite significant advancements, generative models often struggle with these tasks du…

ArticlesQuestion AnsweringRAGRetrieval+3

GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models

2026-06-10 · Garvita Allabadi, Matteo Sodano, Roberto Estevão, Yuxiong Wang 외 arxiv

In-Context Learning (ICL) has become a powerful mechanism for adapting Large Language Models (LLMs) to new tasks without fine-tuning. Extending this concept to Large Multimodal Models (LMMs), Multimodal In-Context Learni…

Visual Question Answering

TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models

2024-06-09 · Leigang Qu, Haochuan Li, Tan Wang, Wenjie Wang 외

How humans can effectively and efficiently acquire images has always been a perennial question. A classic solution is text-to-image retrieval from an existing database; however, the limited database typically lacks creat…

counterfactualImage GenerationImage RetrievalRetrieval+2