paper-with-me

홈 › Papers

Residual Cross-Modal Fusion Networks for Audio-Visual Navigation

2026-01-11 · Yi Wang, Yinfeng Yu, Bin Ren arxiv

Audio-visual embodied navigation aims to enable an agent to autonomously localize and reach a sound source in unseen 3D environments by leveraging auditory cues. The key challenge of this task lies in effectively modeling the interaction between heterogeneous features during multimodal fusion, so as to avoid single-modality dominance or information degradation, particularly in cross-domain scenarios. To address this, we propose a Cross-Modal Residual Fusion Network, which introduces bidirectional residual interactions between audio and visual streams to achieve complementary modeling and fine-grained alignment, while maintaining the independence of their representations. Unlike conventional methods that rely on simple concatenation or attention gating, CRFN explicitly models cross-modal interactions via residual connections and incorporates stabilization techniques to improve convergence and robustness. Experiments on the Replica and Matterport3D datasets demonstrate that CRFN significantly outperforms state-of-the-art fusion baselines and achieves stronger cross-domain generalization. Notably, our experiments also reveal that agents exhibit differentiated modality dependence across different datasets. The discovery of this phenomenon provides a new perspective for understanding the cross-modal collaboration mechanism of embodied agents.

📄 PDF Abstract BibTeX arXiv:2601.08868

Code (0)

등록된 구현이 없습니다.

Tasks

Domain GeneralizationVisual Navigation

Similar Papers 제목 키워드 기반

Iterative Residual Cross-Attention Mechanism: An Integrated Approach for Audio-Visual Navigation Tasks

2025-09-30 · Hailong Zhang, Yinfeng Yu, Liejun Wang, Fuchun Sun 외 arxiv

Audio-visual navigation represents a significant area of research in which intelligent agents utilize egocentric visual and auditory perceptions to identify audio targets. Conventional navigation methodologies typically …

Reinforcement LearningVisual Navigation

Audio-Visual Event Localization in Unconstrained Videos

2018-03-23 · ECCV 2018 9 · Yapeng Tian, Jing Shi, Bochen Li, Zhiyao Duan 외

In this paper, we introduce a novel problem of audio-visual event localization in unconstrained videos. We define an audio-visual event as an event that is both visible and audible in a video segment. We collect an Audio…

audio-visual event localizationTemporal Localization

Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning

2026-01-31 · Mohamed Saleh, Zahra Ahmadi arxiv

Effective multimodal fusion requires mechanisms that can capture complex cross-modal dependencies while remaining computationally scalable for real-world deployment. Existing audio-visual fusion approaches face a fundame…

Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning

2025-02-18 · Xiang He, Dongcheng Zhao, Yiting Dong, Guobin Shen 외

Humans interpret and perceive the world by integrating sensory information from multiple modalities, such as vision and hearing. Spiking Neural Networks (SNNs), as brain-inspired computational models, exhibit unique adva…

End-to-end Audiovisual Speech Recognition

2018-02-18 · IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) 2018 9 · Stavros Petridis, Themos Stafylakis, Pingchuan Ma, Feipeng Cai 외

Several end-to-end deep learning approaches have been recently presented which extract either audio or visual features from the input images or audio signals and perform speech recognition. However, research on end-to-en…

Lipreadingspeech-recognitionSpeech Recognition