paper-with-me

홈 › Papers

CluMo: Cluster-based Modality Fusion Prompt for Continual Learning in Visual Question Answering

2024-08-21 · Yuliang Cai, Mohammad Rostami

Large vision-language models (VLMs) have shown significant performance boost in various application domains. However, adopting them to deal with several sequentially encountered tasks has been challenging because finetuning a VLM on a task normally leads to reducing its generalization power and the capacity of learning new tasks as well as causing catastrophic forgetting on previously learned tasks. Enabling using VLMs in multimodal continual learning (CL) settings can help to address such scenarios. To improve generalization capacity and prevent catastrophic forgetting, we propose a novel prompt-based CL method for VLMs, namely $\textbf{Clu}$ster-based $\textbf{Mo}$dality Fusion Prompt (\textbf{CluMo}). We design a novel \textbf{Key-Key-Prompt} pair, where each prompt is associated with a visual prompt key and a textual prompt key. We adopt a two-stage training strategy. During the first stage, the single-modal keys are trained via $K$-means clustering algorithm to help select the best semantically matched prompt. During the second stage, the prompt keys are frozen, the selected prompt is attached to the input for training the VLM in the CL scenario. Experiments on two benchmarks demonstrate that our method achieves SOTA performance.

📄 PDF Abstract BibTeX arXiv:2408.11742

Code (1)

yuliangcai2022/clumo 공식 구현 pytorch

Tasks

Continual LearningQuestion AnsweringVisual Question Answering

Similar Papers 제목 키워드 기반

ModalPrompt:Dual-Modality Guided Prompt for Continual Learning of Large Multimodal Models

2024-10-08 · Fanhu Zeng, Fei Zhu, Haiyang Guo, Xu-Yao Zhang 외

Large Multimodal Models (LMMs) exhibit remarkable multi-tasking ability by learning mixed datasets jointly. However, novel tasks would be encountered sequentially in dynamic world, and continually fine-tuning LMMs often …

Continual LearningPrompt LearningTransfer Learning

Efficient Prompting for Continual Adaptation to Missing Modalities

2025-03-01 · Zirun Guo, Shulei Wang, Wang Lin, Weicai Yan 외

Missing modality issues are common in real-world applications, arising from factors such as equipment failures and privacy concerns. When fine-tuning pre-trained models on downstream datasets with missing modalities, per…

Continual Learning

MM-Prompt: Cross-Modal Prompt Tuning for Continual Visual Question Answering

2025-05-26 · Xu Li, Fan Lyu

Continual Visual Question Answering (CVQA) based on pre-trained models(PTMs) has achieved promising progress by leveraging prompt tuning to enable continual multi-modal learning. However, most existing methods adopt cros…

Continual LearningQuestion AnsweringVisual Question Answering

MedCRP-CL: Continual Medical Image Segmentation via Bayesian Nonparametric Semantic Modality Discovery

2026-05-19 · Ziyuan Gao arxiv

Medical image segmentation faces a fundamental challenge in continual learning: data arrives sequentially from heterogeneous sources, yet effective continual learning requires discovering which tasks share sufficient str…

Medical Image SegmentationContinual Learning

CM2-Net: Continual Cross-Modal Mapping Network for Driver Action Recognition

2024-06-17 · Ruoyu Wang, Chen Cai, Wenqian Wang, Jianjun Gao 외

Driver action recognition has significantly advanced in enhancing driver-vehicle interactions and ensuring driving safety by integrating multiple modalities, such as infrared and depth. Nevertheless, compared to RGB moda…

Action RecognitionContinual Learning