paper-with-me

홈 › Papers

Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification

2026-04-12 · Jiayu Zhang, Shuo Ye, Qilang Ye, Zihan Song, Jiajian Huang, Zitong Yu arxiv

Recent Audio-Visual Question Answering (AVQA) methods have advanced significantly. However, most AVQA methods lack effective mechanisms for handling missing modalities, suffering from severe performance degradation in real-world scenarios with data interruptions. Furthermore, prevailing methods for handling missing modalities predominantly rely on generative imputation to synthesize missing features. While partially effective, these methods tend to capture inter-modal commonalities but struggle to acquire unique, modality-specific knowledge within the missing data, leading to hallucinations and compromised reasoning accuracy. To tackle these challenges, we propose R$^{2}$ScP, a novel framework that shifts the paradigm of missing modality handling from traditional generative imputation to retrieval-based recovery. Specifically, we leverage cross-modal retrieval via unified semantic embeddings to acquire missing domain-specific knowledge. To maximize semantic restoration, we introduce a context-aware adaptive purification mechanism that eliminates latent semantic noise within the retrieved data. Additionally, we employ a two-stage training strategy to explicitly model the semantic relationships between knowledge from different sources. Extensive experiments demonstrate that R$^{2}$ScP significantly improves AVQA and enhances robustness in modal-incomplete scenarios.

📄 PDF Abstract BibTeX arXiv:2604.10695

Code (0)

등록된 구현이 없습니다.

Tasks

Audio-visual Question AnsweringCross-Modal Retrieval

Similar Papers 제목 키워드 기반

Evaluating Knowledge Graph Based Retrieval Augmented Generation Methods under Knowledge Incompleteness

2025-04-07 · Dongzhuoran Zhou, Yuqicheng Zhu, Yuan He, Jiaoyan Chen 외

Knowledge Graph based Retrieval-Augmented Generation (KG-RAG) is a technique that enhances Large Language Model (LLM) inference in tasks like Question Answering (QA) by retrieving relevant information from knowledge grap…

Knowledge GraphsLanguage ModelingLanguage ModellingLarge Language Model+4

Audiopedia: Audio QA with Knowledge

2024-12-29 · Abhirama Subramanyam Penamakuri, Kiran Chhatre, Akshat Jain

In this paper, we introduce Audiopedia, a novel task called Audio Question Answering with Knowledge, which requires both audio comprehension and external knowledge reasoning. Unlike traditional Audio Question Answering (…

Audio Question AnsweringEntity LinkingQuestion Answering

Learning to Unify Audio, Visual and Text for Audio-Enhanced Multilingual Visual Answer Localization

2024-11-05 · Zhibin Wen, Bin Li

The goal of Multilingual Visual Answer Localization (MVAL) is to locate a video segment that answers a given multilingual question. Existing methods either focus solely on visual modality or integrate visual and subtitle…

Global-Local Distillation Network-Based Audio-Visual Speaker Tracking with Incomplete Modalities

2024-08-26 · Yidi Li, Yihan Li, Yixin Guo, Bin Ren 외

In speaker tracking research, integrating and complementing multi-modal data is a crucial strategy for improving the accuracy and robustness of tracking systems. However, tracking with incomplete modalities remains a cha…

Generative Adversarial Network

Retrieving Visual Facts For Few-Shot Visual Question Answering

2022-01-16 · ACL ARR January 2022 1 · Anonymous

We introduce the Retrieving Visual Facts (RVF) framework for few-shot visual question answering (VQA). The RVF framework represents an image as a set of natural language facts; for example, in practice these could be tag…

Language ModelingLanguage ModellingQuestion AnsweringVisual Question Answering+1