paper-with-me

홈 › Papers

OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models

2026-04-01 · Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Povey arxiv

We present OmniVoice, a massively multilingual zero-shot text-to-speech (TTS) model that scales to over 600 languages. At its core is a novel diffusion language model-style discrete non-autoregressive (NAR) architecture. Unlike conventional discrete NAR models that suffer from performance bottlenecks in complex two-stage (text-to-semantic-to-acoustic) pipelines, OmniVoice directly maps text to multi-codebook acoustic tokens. This simplified approach is facilitated by two key technical innovations: (1) a full-codebook random masking strategy for efficient training, and (2) initialization from a pre-trained LLM to ensure superior intelligibility. By leveraging a 581k-hour multilingual dataset curated entirely from open-source data, OmniVoice achieves the broadest language coverage to date and delivers state-of-the-art performance across Chinese, English, and diverse multilingual benchmarks. Our code and pre-trained models are publicly available at https://github.com/k2-fsa/OmniVoice.

📄 PDF Abstract BibTeX arXiv:2604.00688

Code (0)

등록된 구현이 없습니다.

Similar Papers 제목 키워드 기반

Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages

2025-11-12 · Omnilingual ASR team, Gil Keren, Artyom Kozhevnikov, Yen Meng 외 arxiv

Automatic speech recognition (ASR) has advanced in high-resource languages, but most of the world's 7,000+ languages remain unsupported, leaving thousands of long-tail languages behind. Expanding ASR coverage has been co…

Zero-shot GeneralizationSpeech Recognition

PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech

2026-05-26 · Hanif Rahman arxiv

Text-to-speech (TTS) evaluation for low-resource non-Latin-script languages can fail when it relies on a single ASR round-trip word error rate (WER). A system may produce no audio, speak a neighbouring language, preserve…

Language Identification

Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech

2026-03-17 · Omnilingual SONAR Team, João Maria Janeiro, Pere-Lluís Huguet Cabot, Ioannis Tsiamas 외 arxiv

Cross-lingual sentence encoders typically cover only a few hundred languages and often trade downstream quality for stronger alignment, limiting their adoption. We introduce OmniSONAR, a new family of omnilingual, cross-…

SamaVaani: Auditing and Debiasing Multilingual Clinical ASR for Indian Languages

2026-06-25 · Subham Kumar, Prakrithi Shivaprakash, Abhishek Manoharan, Astut Kurariya 외 arxiv

Automatic Speech Recognition (ASR) is increasingly used to document clinical encounters, yet its reliability in multilingual and demographically diverse Indian healthcare context remains largely unknown. In this study, w…

Speech Recognition

Unified Vision-Language Modeling via Concept Space Alignment

2026-03-01 · Yifu Qiu, Paul-Ambroise Duquenne, Holger Schwenk arxiv

We introduce V-SONAR, a vision-language embedding space extended from the text-only embedding space SONAR (Omnilingual Embeddings Team et al., 2026), which supports 1500 text languages and 177 speech languages. To constr…

Question AnsweringVideo CaptioningVideo Retrieval