Noisy Speech Recognition
2개 벤치마크 · 논문 13편 · 이 태스크의 논문 보기 →
Benchmarks
CHiME real
CHiME clean
Most implemented
Deep Speech 2: End-to-End Speech Recognition in English and Mandarin
The PyTorch-Kaldi Speech Recognition Toolkit
Papers
Efficient Extraction of Noise-Robust Discrete Units from Self-Supervised Speech Models
Continuous speech can be converted into a discrete sequence by deriving discrete units from the hidden features of self-supervised learned (SSL) speech models. Although SSL models are becoming larger and trained on more …
DecoderNoisy Speech Recognitionspeech-recognitionSpeech RecognitionDirection-Aware Joint Adaptation of Neural Speech Enhancement and Recognition in Real Multiparty Conversational Environments
This paper describes noisy speech recognition for an augmented reality headset that helps verbal communication within real multiparty conversational environments. A major approach that has actively been studied in simula…
Automatic Speech RecognitionAutomatic Speech Recognition (ASR)Distant Speech RecognitionNoisy Speech Recognition+3Visual Context-driven Audio Feature Enhancement for Robust End-to-End Audio-Visual Speech Recognition
This paper focuses on designing a noise-robust end-to-end Audio-Visual Speech Recognition (AVSR) system. To this end, we propose Visual Context-driven Audio Feature Enhancement module (V-CAFE) to enhance the input noisy …
Audio-Visual Speech RecognitionDecoderNoisy Speech Recognitionspeech-recognition+2Improving Noise Robustness of Contrastive Speech Representation Learning with Speech Reconstruction
Noise robustness is essential for deploying automatic speech recognition (ASR) systems in real-world environments. One way to reduce the effect of noise interference is to employ a preprocessing module that conducts spee…
Automatic Speech RecognitionAutomatic Speech Recognition (ASR)Auxiliary LearningContrastive Learning+8Speech Recognition With No Speech Or With Noisy Speech Beyond English
In this paper we demonstrate continuous noisy speech recognition using connectionist temporal classification (CTC) model on limited Chinese vocabulary using electroencephalography (EEG) features with no speech signal as …
EEGElectroencephalogram (EEG)General ClassificationNoisy Speech Recognition+2An Investigation of End-to-End Multichannel Speech Recognition for Reverberant and Mismatch Conditions
Sequence-to-sequence (S2S) modeling is becoming a popular paradigm for automatic speech recognition (ASR) because of its ability to jointly optimize all the conventional ASR components in an end-to-end (E2E) fashion. Thi…
Automatic Speech RecognitionAutomatic Speech Recognition (ASR)DenoisingNoisy Speech Recognition+3