paper-with-me

홈 › Papers

Modality Attention for End-to-End Audio-visual Speech Recognition

2018-11-13 · Pan Zhou, Wenwen Yang, Wei Chen, Yan-Feng Wang, Jia Jia

Audio-visual speech recognition (AVSR) system is thought to be one of the most promising solutions for robust speech recognition, especially in noisy environment. In this paper, we propose a novel multimodal attention based method for audio-visual speech recognition which could automatically learn the fused representation from both modalities based on their importance. Our method is realized using state-of-the-art sequence-to-sequence (Seq2seq) architectures. Experimental results show that relative improvements from 2% up to 36% over the auditory modality alone are obtained depending on the different signal-to-noise-ratio (SNR). Compared to the traditional feature concatenation methods, our proposed approach can achieve better recognition performance under both clean and noisy conditions. We believe modality attention based end-to-end method can be easily generalized to other multimodal tasks with correlated information.

📄 PDF Abstract BibTeX arXiv:1811.05250

Code (0)

등록된 구현이 없습니다.

Tasks

Audio-Visual Speech RecognitionRobust Speech Recognitionspeech-recognitionSpeech RecognitionVisual Speech Recognition

Similar Papers 제목 키워드 기반

Discriminative Multi-modality Speech Recognition

2020-05-12 · CVPR 2020 6 · Bo Xu, Cheng Lu, Yandong Guo, Jacob Wang

Vision is often used as a complementary modality for audio speech recognition (ASR), especially in the noisy environment where performance of solo audio modality significantly deteriorates. After combining visual modalit…

Audio-Visual Speech RecognitionLipreadingspeech-recognitionSpeech Recognition

MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition

2024-01-07 · He Wang, Pengcheng Guo, Pan Zhou, Lei Xie

While automatic speech recognition (ASR) systems degrade significantly in noisy environments, audio-visual speech recognition (AVSR) systems aim to complement the audio stream with noise-invariant visual cues and improve…

Audio-Visual Speech RecognitionAutomatic Speech RecognitionAutomatic Speech Recognition (ASR)Representation Learning+3

Attentive Fusion Enhanced Audio-Visual Encoding for Transformer Based Robust Speech Recognition

2020-08-06 · Liangfa Wei, Jie Zhang, JunFeng Hou, Li-Rong Dai

Audio-visual information fusion enables a performance improvement in speech recognition performed in complex acoustic scenarios, e.g., noisy environments. It is required to explore an effective audio-visual fusion strate…

Robust Speech Recognitionspeech-recognitionSpeech Recognition

Improving Noise Robust Audio-Visual Speech Recognition via Router-Gated Cross-Modal Feature Fusion

2025-08-26 · DongHoon Lim, YoungChae Kim, Dong-Hyun Kim, Da-Hee Yang 외 arxiv

Robust audio-visual speech recognition (AVSR) in noisy environments remains challenging, as existing systems struggle to estimate audio reliability and dynamically adjust modality reliance. We propose router-gated cross-…

Audio-Visual Speech Recognition

Large Language Models are Strong Audio-Visual Speech Recognition Learners

2024-09-18 · Umberto Cappellazzo, Minsu Kim, Honglie Chen, Pingchuan Ma 외

Multimodal large language models (MLLMs) have recently become a focal point of research due to their formidable multimodal understanding capabilities. For example, in the audio and speech domains, an LLM can be equipped …

Audio-Visual Speech RecognitionAutomatic Speech RecognitionAutomatic Speech Recognition (ASR)speech-recognition+2