paper-with-me

홈 › Papers

Hierarchical Softmax for End-to-End Low-resource Multilingual Speech Recognition

2022-04-08 · Qianying Liu, Zhuo Gong, Zhengdong Yang, Yuhang Yang, Sheng Li, Chenchen Ding, Nobuaki Minematsu, Hao Huang, Fei Cheng, Chenhui Chu, Sadao Kurohashi

Low-resource speech recognition has been long-suffering from insufficient training data. In this paper, we propose an approach that leverages neighboring languages to improve low-resource scenario performance, founded on the hypothesis that similar linguistic units in neighboring languages exhibit comparable term frequency distributions, which enables us to construct a Huffman tree for performing multilingual hierarchical Softmax decoding. This hierarchical structure enables cross-lingual knowledge sharing among similar tokens, thereby enhancing low-resource training outcomes. Empirical analyses demonstrate that our method is effective in improving the accuracy and efficiency of low-resource speech recognition.

📄 PDF Abstract BibTeX arXiv:2204.03855

Code (1)

Derek-Gong/hsoftmax 공식 구현 pytorch

Tasks

speech-recognitionSpeech Recognition

Methods 이 논문이 사용한 방법론

Softmax The Softmax output function transforms a previous layer's output into a vector of probabilities. It is commonly used for multiclass classification. Given an input vector $x$…
Hierarchical Softmax 설명 없음

Similar Papers 제목 키워드 기반

Cross-lingual Embedding Clustering for Hierarchical Softmax in Low-Resource Multilingual Speech Recognition

2025-01-29 · Zhengdong Yang, Qianying Liu, Sheng Li, Fei Cheng 외

We present a novel approach centered on the decoding stage of Automatic Speech Recognition (ASR) that enhances multilingual performance, especially for low-resource languages. It utilizes a cross-lingual embedding cluste…

Automatic Speech RecognitionAutomatic Speech Recognition (ASR)Decoderspeech-recognition+1

Adapt-and-Adjust: Overcoming the Long-Tail Problem of Multilingual Speech Recognition

2020-12-03 · Genta Indra Winata, Guangsen Wang, Caiming Xiong, Steven Hoi

One crucial challenge of real-world multilingual speech recognition is the long-tailed distribution problem, where some resource-rich languages like English have abundant training data, but a long tail of low-resource la…

Language ModelingLanguage ModellingMulti-Task Learningspeech-recognition+1

Latent Softmax for Data-Efficient Phoneme-Based Multilingual ASR Across Tonal and Non-Tonal Languages

2026-08-02 · Saierdaer Yusuyin, Nanling Jiang, Hao Huang, Zhijian Ou arxiv

Phoneme-based multilingual automatic speech recognition (ASR) can share acoustic evidence across languages more directly than language-specific subword modeling. When tonal and non-tonal languages are jointly trained, ho…

Bytes are All You Need: End-to-End Multilingual Speech Recognition and Synthesis with Bytes

2018-11-22 · Bo Li, Yu Zhang, Tara Sainath, Yonghui Wu 외

We present two end-to-end models: Audio-to-Byte (A2B) and Byte-to-Audio (B2A), for multilingual speech recognition and synthesis. Prior work has predominantly used characters, sub-words or words as the unit of choice to …

Allspeech-recognitionSpeech RecognitionSpeech Synthesis

LUPET: Incorporating Hierarchical Information Path into Multilingual ASR

2024-01-08 · Wei Liu, Jingyong Hou, Dong Yang, Muyong Cao 외

Toward high-performance multilingual automatic speech recognition (ASR), various types of linguistic information and model design have demonstrated their effectiveness independently. They include language identity (LID),…

Acoustic Unit DiscoveryAutomatic Speech RecognitionAutomatic Speech Recognition (ASR)speech-recognition+1