paper-with-me

Papers

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models

2025-06-06 · Yuke Lin, Ming Cheng, Ze Li, Beilong Tang, Ming Li

Multi-speaker automatic speech recognition (MS-ASR) faces significant challenges in transcribing overlapped speech, a task critical for applications like meeting transcription and conversational analysis. While serialized output training (SOT)-style methods serve as common solutions, they often discard absolute timing information, limiting their utility in time-sensitive scenarios. Leveraging recent advances in large language models (LLMs) for conversational audio processing, we propose a novel diarization-aware multi-speaker ASR system that integrates speaker diarization with LLM-based transcription. Our framework processes structured diarization inputs alongside frame-level speaker and semantic embeddings, enabling the LLM to generate segment-level transcriptions. Experiments demonstrate that the system achieves robust performance in multilingual dyadic conversations and excels in complex, high-overlap multi-speaker meeting scenarios. This work highlights the potential of LLMs as unified back-ends for joint speaker-aware segmentation and transcription.

📄 PDF Abstract BibTeX arXiv:2506.05796

Code (0)

등록된 구현이 없습니다.

Tasks

Automatic Speech Recognitionspeaker-diarizationSpeaker Diarizationspeech-recognitionSpeech Recognition

Similar Papers 제목 키워드 기반

DiaCorrect: End-to-end error correction for speaker diarization

2022-10-31 · Jiangyu Han, Yuhang Cao, Heng Lu, Yanhua Long

In recent years, speaker diarization has attracted widespread attention. To achieve better performance, some studies propose to diarize speech in multiple stages. Although these methods might bring additional benefits, m…

Automatic Speech RecognitionAutomatic Speech Recognition (ASR)speaker-diarizationSpeaker Diarization+3

LibriConvo: Simulating Conversations from Read Literature for ASR and Diarization

2025-10-27 · Máté Gedeon, Péter Mihajlik arxiv

We introduce LibriConvo, a synthetic conversational speech corpus for speaker diarization and automatic speech recognition (ASR), built by instantiating the previously proposed Speaker-Aware Simulated Conversation (SASC)…

Speaker DiarizationSpeech RecognitionActivity Detection

Speech-Aware Neural Diarization with Encoder-Decoder Attractor Guided by Attention Constraints

2024-03-21 · PeiYing Lee, HauYun Guo, Berlin Chen

End-to-End Neural Diarization with Encoder-Decoder based Attractor (EEND-EDA) is an end-to-end neural model for automatic speaker segmentation and labeling. It achieves the capability to handle flexible number of speaker…

Decoder

Speaker Embedding-aware Neural Diarization for Flexible Number of Speakers with Textual Information

2021-11-28 · Zhihao Du, Shiliang Zhang, Siqi Zheng, Weilong Huang 외

Overlapping speech diarization is always treated as a multi-label classification problem. In this paper, we reformulate this task as a single-label prediction problem by encoding the multi-speaker labels with power set. …

Action DetectionActivity DetectionMulti-Label ClassificationMUlTI-LABEL-ClASSIFICATION+1

Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization

2024-01-16 · Ming Cheng, Ming Li

Audio-visual learning has demonstrated promising results in many classical speech tasks (e.g., speech separation, automatic speech recognition, wake-word spotting). We believe that introducing visual modality will also b…

Action DetectionActivity Detectionaudio-visual learningAutomatic Speech Recognition+5