paper-with-me

Papers

Learning Trimodal Relation for AVQA with Missing Modality

2024-07-23 · Kyu Ri Park, Hong Joo Lee, Jung Uk Kim

Recent Audio-Visual Question Answering (AVQA) methods rely on complete visual and audio input to answer questions accurately. However, in real-world scenarios, issues such as device malfunctions and data transmission errors frequently result in missing audio or visual modality. In such cases, existing AVQA methods suffer significant performance degradation. In this paper, we propose a framework that ensures robust AVQA performance even when a modality is missing. First, we propose a Relation-aware Missing Modal (RMM) generator with Relation-aware Missing Modal Recalling (RMMR) loss to enhance the ability of the generator to recall missing modal information by understanding the relationships and context among the available modalities. Second, we design an Audio-Visual Relation-aware (AVR) diffusion model with Audio-Visual Enhancing (AVE) loss to further enhance audio-visual features by leveraging the relationships and shared cues between the audio-visual modalities. As a result, our method can provide accurate answers by effectively utilizing available information even when input modalities are missing. We believe our method holds potential applications not only in AVQA research but also in various multi-modal scenarios.

📄 PDF Abstract BibTeX arXiv:2407.16171

Code (1)

visualaikhu/missing-avqa 공식 구현 pytorch

Tasks

Audio-visual Question AnsweringAudio-Visual Question Answering (AVQA)Question AnsweringRelationVisual Question Answering

Methods 이 논문이 사용한 방법론

Diffusion Diffusion models generate samples by gradually removing noise from a signal, and their training objective can be expressed as a reweighted variational lower-bound…

Similar Papers 제목 키워드 기반

Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification

2026-04-12 · Jiayu Zhang, Shuo Ye, Qilang Ye, Zihan Song 외 arxiv

Recent Audio-Visual Question Answering (AVQA) methods have advanced significantly. However, most AVQA methods lack effective mechanisms for handling missing modalities, suffering from severe performance degradation in re…

Audio-visual Question AnsweringCross-Modal Retrieval

A Multimodal Sensor Fusion Framework Robust to Missing Modalities for Person Recognition

2022-10-20 · Vijay John, Yasutomo Kawanishi

Utilizing the sensor characteristics of the audio, visible camera, and thermal camera, the robustness of person recognition can be enhanced. Existing multimodal person recognition frameworks are primarily formulated assu…

Person RecognitionSensor FusionTriplet

Multimodal Confidence Modeling in Audio-Visual Quality Assessment

2026-05-02 · Mayesha Maliha R. Mithila, Mylene C. Q. Farias arxiv

Audio-visual quality assessment (AVQA) is essential for streaming, teleconferencing, and immersive media. In realistic streaming scenarios, distortions are often asymmetric, where one modality may be severely degraded wh…

Tackling Data Bias in MUSIC-AVQA: Crafting a Balanced Dataset for Unbiased Question-Answering

2023-10-10 · Xiulong Liu, Zhikang Dong, Peng Zhang

In recent years, there has been a growing emphasis on the intersection of audio, vision, and text modalities, driving forward the advancements in multimodal research. However, strong bias that exists in any modality can …

AUDIO-VISUAL QUESTION ANSWERING (MUSIC-AVQA-v2.0)Question Answering

Handling Missing Modalities in Multimodal Survival Prediction for Non-Small Cell Lung Cancer

2026-01-15 · Filippo Ruffini, Camillo Maria Caruso, Claudia Tacconi, Lorenzo Nibid 외 arxiv

Accurate survival prediction in Non-Small Cell Lung Cancer (NSCLC) requires integrating clinical, radiological, and histopathological data. Multimodal Deep Learning (MDL) can improve precision prognosis, but small cohort…

Multimodal Deep Learning