paper-with-me

Papers

ASR Error Correction and Domain Adaptation Using Machine Translation

2020-03-13 · Anirudh Mani, Shruti Palaskar, Nimshi Venkat Meripo, Sandeep Konam, Florian Metze

Off-the-shelf pre-trained Automatic Speech Recognition (ASR) systems are an increasingly viable service for companies of any size building speech-based products. While these ASR systems are trained on large amounts of data, domain mismatch is still an issue for many such parties that want to use this service as-is leading to not so optimal results for their task. We propose a simple technique to perform domain adaptation for ASR error correction via machine translation. The machine translation model is a strong candidate to learn a mapping from out-of-domain ASR errors to in-domain terms in the corresponding reference files. We use two off-the-shelf ASR systems in this work: Google ASR (commercial) and the ASPIRE model (open-source). We observe 7% absolute improvement in word error rate and 4 point absolute improvement in BLEU score in Google ASR output via our proposed method. We also evaluate ASR error correction via a downstream task of Speaker Diarization that captures speaker style, syntax, structure and semantic improvements we obtain via ASR correction.

📄 PDF Abstract BibTeX arXiv:2003.07692

Code (0)

등록된 구현이 없습니다.

Tasks

Automatic Speech RecognitionAutomatic Speech Recognition (ASR)Domain AdaptationMachine Translationspeaker-diarizationSpeaker Diarizationspeech-recognitionSpeech RecognitionTranslation

Similar Papers 제목 키워드 기반

Towards Understanding ASR Error Correction for Medical Conversations

2020-07-01 · WS 2020 7 · Anirudh Mani, Shruti Palaskar, S Konam, eep

Domain Adaptation for Automatic Speech Recognition (ASR) error correction via machine translation is a useful technique for improving out-of-domain outputs of pre-trained ASR systems to obtain optimal results for specifi…

Automatic Speech RecognitionAutomatic Speech Recognition (ASR)DiagnosticDomain Adaptation+4

Online Learning over Time in Adaptive Neural Machine Translation

2021-09-01 · RANLP 2021 9 · Thierry Etchegoyhen, David Ponce, Harritxu Gete, Victor Ruiz

Adaptive Machine Translation purports to dynamically include user feedback to improve translation quality. In a post-editing scenario, user corrections of machine translation output are thus continuously incorporated int…

Machine TranslationTranslation

RoundTripOCR: A Data Generation Technique for Enhancing Post-OCR Error Correction in Low-Resource Devanagari Languages

2024-12-14 · Harshvivek Kashid, Pushpak Bhattacharyya

Optical Character Recognition (OCR) technology has revolutionized the digitization of printed text, enabling efficient data extraction and analysis across various domains. Just like Machine Translation systems, OCR syste…

Machine TranslationOptical Character RecognitionOptical Character Recognition (OCR)Synthetic Data Generation+1

Approaching Neural Grammatical Error Correction as a Low-Resource Machine Translation Task

2018-04-16 · NAACL 2018 6 · Marcin Junczys-Dowmunt, Roman Grundkiewicz, Shubha Guha, Kenneth Heafield

Previously, neural methods in grammatical error correction (GEC) did not reach state-of-the-art results compared to phrase-based statistical machine translation (SMT) baselines. We demonstrate parallels between neural GE…

Domain AdaptationGrammatical Error CorrectionMachine TranslationTransfer Learning+1

Multi-modular domain-tailored OCR post-correction

2017-09-01 · EMNLP 2017 9 · Sarah Schulz, Jonas Kuhn

One of the main obstacles for many Digital Humanities projects is the low data availability. Texts have to be digitized in an expensive and time consuming process whereas Optical Character Recognition (OCR) post-correcti…

DiversityMachine TranslationOptical Character RecognitionOptical Character Recognition (OCR)+1