paper-with-me

홈 › Papers

Fourier Prompt Tuning for Modality-Incomplete Scene Segmentation

2024-01-30 · Ruiping Liu, Jiaming Zhang, Kunyu Peng, Yufan Chen, Ke Cao, Junwei Zheng, M. Saquib Sarfraz, Kailun Yang, Rainer Stiefelhagen

Integrating information from multiple modalities enhances the robustness of scene perception systems in autonomous vehicles, providing a more comprehensive and reliable sensory framework. However, the modality incompleteness in multi-modal segmentation remains under-explored. In this work, we establish a task called Modality-Incomplete Scene Segmentation (MISS), which encompasses both system-level modality absence and sensor-level modality errors. To avoid the predominant modality reliance in multi-modal fusion, we introduce a Missing-aware Modal Switch (MMS) strategy to proactively manage missing modalities during training. Utilizing bit-level batch-wise sampling enhances the model's performance in both complete and incomplete testing scenarios. Furthermore, we introduce the Fourier Prompt Tuning (FPT) method to incorporate representative spectral information into a limited number of learnable prompts that maintain robustness against all MISS scenarios. Akin to fine-tuning effects but with fewer tunable parameters (1.1%). Extensive experiments prove the efficacy of our proposed approach, showcasing an improvement of 5.84% mIoU over the prior state-of-the-art parameter-efficient methods in modality missing. The source code is publicly available at https://github.com/RuipingL/MISS.

📄 PDF Abstract BibTeX arXiv:2401.16923

Code (1)

ruipingl/miss 공식 구현 pytorch

Tasks

Autonomous VehiclesScene Segmentation

Similar Papers 제목 키워드 기반

Robust RGB-T Tracking via Learnable Visual Fourier Prompt Fine-tuning and Modality Fusion Prompt Generation

2025-09-24 · Hongtao Yang, Bineng Zhong, Qihua Liang, Zhiruo Zhu 외 arxiv

Recently, visual prompt tuning is introduced to RGB-Thermal (RGB-T) tracking as a parameter-efficient finetuning (PEFT) method. However, these PEFT-based RGB-T tracking methods typically rely solely on spatial domain inf…

Visual Prompt TuningRgb-T Tracking

Retrieval-Augmented Dynamic Prompt Tuning for Incomplete Multimodal Learning

2025-01-02 · Jian Lang, Zhangtao Cheng, Ting Zhong, Fan Zhou

Multimodal learning with incomplete modality is practical and challenging. Recently, researchers have focused on enhancing the robustness of pre-trained MultiModal Transformers (MMTs) under missing modality conditions by…

ImputationRetrieval

MuAP: Multi-step Adaptive Prompt Learning for Vision-Language Model with Missing Modality

2024-09-07 · Ruiting Dai, Yuqiao Tan, Lisi Mo, Tao He 외

Recently, prompt learning has garnered considerable attention for its success in various Vision-Language (VL) tasks. However, existing prompt-based models are primarily focused on studying prompt generation and prompt st…

Language ModelingLanguage ModellingPrompt Learning

TriSPrompt: A Hierarchical Soft Prompt Model for Multimodal Rumor Detection with Incomplete Modalities

2025-09-18 · Jiajun Chen, Yangyang Wu, Xiaoye Miao, Mengying Zhu 외 arxiv

The widespread presence of incomplete modalities in multimodal data poses a significant challenge to achieving accurate rumor detection. Existing multimodal rumor detection methods primarily focus on learning joint modal…

DeLo: Dual Decomposed Low-Rank Experts Collaboration for Continual Missing Modality Learning

2026-03-02 · Xiwei Liu, Yulong Li, Feilong Tang, Imran Razzak arxiv

Adapting Large Multimodal Models (LMMs) to real-world scenarios poses the dual challenges of learning from sequential data streams while handling frequent modality incompleteness, a task known as Continual Missing Modali…