paper-with-me

Papers

Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

2026-07-04 · SungHun Kim, SeungJun Baek arxiv

Audio-Visual Question Answering (AVQA) extends classical VQA by requiring joint reasoning over video and synchronized audio. However, many AVQA systems rely on deeply stacked layers of self- and cross attention across text, video, and audio. Such sequential stacking may incur loss of information such as subtle inter-modal cues over the layers, causing errors to accumulate across sequential attention layers during the fusion. We introduce Q-TriM which performs multi-modal fusion in a shallow and parallel manner instead of a deep and sequential manner. For Q-TriM, we propose a novel framework for attention operation incorporating video and audio conditioned on text. As a result, we obtain not only standard cross attention outputs but also Tri-Modal Attention representations in which Query, Key, and Value come from distinct modalities. These attention representations are combined in parallel at a single stage, thus avoiding the multi-modal fusion with deep stacks in order to mitigate error accumulation and depth-induced issues. Q-TriM achieves state-of-the-art performance on three AVQA benchmarks, including substantial gains on MUSIC-AVQA-R, which demonstrates its robustness and out-of-distribution generalization. Code is available at https://github.com/Sunghun95/Q-TriM

📄 PDF Abstract BibTeX arXiv:2607.03825

Code (0)

등록된 구현이 없습니다.

Tasks

Audio-visual Question Answering

Similar Papers 제목 키워드 기반

Past and Future Motion Guided Network for Audio Visual Event Localization

2022-05-08 · Tingxiu Chen, Jianqin Yin, Jin Tang

In recent years, audio-visual event localization has attracted much attention. It's purpose is to detect the segment containing audio-visual events and recognize the event category from untrimmed videos. Existing methods…

audio-visual event localization

MAST: Multimodal Abstractive Summarization with Trimodal Hierarchical Attention

2020-10-15 · EMNLP (nlpbt) 2020 11 · Aman Khullar, Udit Arora

This paper presents MAST, a new model for Multimodal Abstractive Text Summarization that utilizes information from all three modalities -- text, audio and video -- in a multimodal video. Prior work on multimodal abstract…

Abstractive Text SummarizationMultimodal Abstractive Text SummarizationText Summarization

A Study of Multimodal Person Verification Using Audio-Visual-Thermal Data

2021-10-23 · Madina Abdrakhmanova, Saniya Abushakimova, Yerbolat Khassanov, Huseyin Atakan Varol

In this paper, we study an approach to multimodal person verification using audio, visual, and thermal modalities. The combination of audio and visual modalities has already been shown to be effective for robust person v…

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

2026-01-20 · Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim 외 arxiv

Multimodal foundation models that integrate audio, vision, and language achieve strong performance on reasoning and generation tasks, yet their robustness to adversarial manipulation remains poorly understood. We study a…

Speech Recognition

Learning Trimodal Relation for AVQA with Missing Modality

2024-07-23 · Kyu Ri Park, Hong Joo Lee, Jung Uk Kim

Recent Audio-Visual Question Answering (AVQA) methods rely on complete visual and audio input to answer questions accurately. However, in real-world scenarios, issues such as device malfunctions and data transmission err…

Audio-visual Question AnsweringAudio-Visual Question Answering (AVQA)Question AnsweringRelation+1