paper-with-me

홈 › Papers

Visual-Aware Speech Recognition for Noisy Scenarios

2025-04-09 · Lakshmipathi Balaji, Karan Singla

Humans have the ability to utilize visual cues, such as lip movements and visual scenes, to enhance auditory perception, particularly in noisy environments. However, current Automatic Speech Recognition (ASR) or Audio-Visual Speech Recognition (AVSR) models often struggle in noisy scenarios. To solve this task, we propose a model that improves transcription by correlating noise sources to visual cues. Unlike works that rely on lip motion and require the speaker's visibility, we exploit broader visual information from the environment. This allows our model to naturally filter speech from noise and improve transcription, much like humans do in noisy scenarios. Our method re-purposes pretrained speech and visual encoders, linking them with multi-headed attention. This approach enables the transcription of speech and the prediction of noise labels in video inputs. We introduce a scalable pipeline to develop audio-visual datasets, where visual cues correlate to noise in the audio. We show significant improvements over existing audio-only models in noisy scenarios. Results also highlight that visual cues play a vital role in improved transcription accuracy.

📄 PDF Abstract BibTeX arXiv:2504.07229

Code (0)

등록된 구현이 없습니다.

Tasks

Audio-Visual Speech RecognitionAutomatic Speech RecognitionAutomatic Speech Recognition (ASR)speech-recognitionSpeech RecognitionVisual Speech Recognition

Similar Papers 제목 키워드 기반

Hearing Lips in Noise: Universal Viseme-Phoneme Mapping and Transfer for Robust Audio-Visual Speech Recognition

2023-06-18 · Yuchen Hu, Ruizhe Li, Chen Chen, Chengwei Qin 외

Audio-visual speech recognition (AVSR) provides a promising solution to ameliorate the noise-robustness of audio-only speech recognition with visual information. However, most existing efforts still focus on audio modali…

Audio-Visual Speech Recognitionspeech-recognitionSpeech RecognitionVisual Speech Recognition

Resource aware design of a deep convolutional-recurrent neural network for speech recognition through audio-visual sensor fusion

2018-03-13 · Matthijs Van keirsbilck, Bert Moons, Marian Verhelst

Today's Automatic Speech Recognition systems only rely on acoustic signals and often don't perform well under noisy conditions. Performing multi-modal speech recognition - processing acoustic speech signals and lip-readi…

Automatic Speech RecognitionAutomatic Speech Recognition (ASR)Lip ReadingPhoneme Recognition+3

Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization

2024-12-26 · Yihan Wu, Yichen Lu, Yifan Peng, Xihua Wang 외

Audiovisual Automatic Speech Recognition (AV-ASR) aims to improve speech recognition accuracy by leveraging visual signals. It is particularly challenging in unconstrained real-world scenarios across various domains due …

Automatic Speech Recognitionspeech-recognitionSpeech Recognition

Multimodal Speech Recognition with Unstructured Audio Masking

2020-10-16 · EMNLP (nlpbt) 2020 11 · Tejas Srinivasan, Ramon Sanabria, Florian Metze, Desmond Elliott

Visual context has been shown to be useful for automatic speech recognition (ASR) systems when the speech signal is noisy or corrupted. Previous work, however, has only demonstrated the utility of visual context in an un…

8kAutomatic Speech RecognitionAutomatic Speech Recognition (ASR)speech-recognition+1

Cocktail-Party Audio-Visual Speech Recognition

2025-06-02 · Thai-Binh Nguyen, Ngoc-Quan Pham, Alexander Waibel

Audio-Visual Speech Recognition (AVSR) offers a robust solution for speech recognition in challenging environments, such as cocktail-party scenarios, where relying solely on audio proves insufficient. However, current AV…

Audio-Visual Speech Recognitionspeech-recognitionSpeech RecognitionVisual Speech Recognition