paper-with-me

홈 › Papers

TS-Net: OCR Trained to Switch Between Text Transcription Styles

2021-03-09 · Jan Kohút, Michal Hradiš

Users of OCR systems, from different institutions and scientific disciplines, prefer and produce different transcription styles. This presents a problem for training of consistent text recognition neural networks on real-world data. We propose to extend existing text recognition networks with a Transcription Style Block (TSB) which can learn from data to switch between multiple transcription styles without any explicit knowledge of transcription rules. TSB is an adaptive instance normalization conditioned by identifiers representing consistently transcribed documents (e.g. single document, documents by a single transcriber, or an institution). We show that TSB is able to learn completely different transcription styles in controlled experiments on artificial data, it improves text recognition accuracy on large-scale real-world data, and it learns semantically meaningful transcription style embedding. We also show how TSB can efficiently adapt to transcription styles of new documents from transcriptions of only a few text lines.

📄 PDF Abstract BibTeX arXiv:2103.05489

Code (0)

등록된 구현이 없습니다.

Tasks

Optical Character Recognition (OCR)

Methods 이 논문이 사용한 방법론

Adaptive Instance Normalization 설명 없음
Instance Normalization Instance Normalization (also known as contrast normalization) is a normalization layer where: $$ y_{tijk} = \frac{x_{tijk} - \mu_{ti}}{\sqrt{\sigma_{ti}^2 +…

Similar Papers 제목 키워드 기반

Acoustic and Textual Data Augmentation for Improved ASR of Code-Switching Speech

2018-07-28 · Emre Yilmaz, Henk van den Heuvel, David A. van Leeuwen

In this paper, we describe several techniques for improving the acoustic and language model of an automatic speech recognition (ASR) system operating on code-switching (CS) speech. We focus on the recognition of Frisian-…

Automatic Speech RecognitionAutomatic Speech Recognition (ASR)Data AugmentationLanguage Modeling+3

Using heterogeneity in semi-supervised transcription hypotheses to improve code-switched speech recognition

2021-06-14 · Andrew Slottje, Shannon Wotherspoon, William Hartmann, Matthew Snover 외

Modeling code-switched speech is an important problem in automatic speech recognition (ASR). Labeled code-switched data are rare, so monolingual data are often used to model code-switched speech. These monolingual data m…

Automatic Speech RecognitionAutomatic Speech Recognition (ASR)speech-recognitionSpeech Recognition

CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition

2025-02-26 · Jiaming Zhou, Yujie Guo, Shiwan Zhao, Haoqin Sun 외

Code-switching (CS), the alternation between two or more languages within a single conversation, presents significant challenges for automatic speech recognition (ASR) systems. Existing Mandarin-English code-switching da…

Automatic Speech RecognitionAutomatic Speech Recognition (ASR)speech-recognitionSpeech Recognition

ProSwitch: Knowledge-Guided Instruction Tuning to Switch Between Professional and Non-Professional Responses

2024-03-14 · Chang Zong, Yuyan Chen, Weiming Lu, Jian Shao 외

Large Language Models (LLMs) have demonstrated efficacy in various linguistic applications, including question answering and controlled text generation. However, studies into their ability to switch between opposite styl…

Language ModelingLanguage ModellingQuestion AnsweringText Generation+1

Automatic Detection of Code-switching Style from Acoustics

2018-07-01 · WS 2018 7 · Rallab, SaiKrishna i, Sunayana Sitaram, Alan W. black

Multilingual speakers switch between languages in an non-trivial fashion displaying inter sentential, intra sentential, and congruent lexicalization based transitions. While monolingual ASR systems may be capable of reco…

Automatic Speech Recognition (ASR)Language Identificationspeech-recognitionSpeech Recognition