paper-with-me

홈 › Papers

Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization

2024-08-22 · Luyao Cheng, Hui Wang, Siqi Zheng, Yafeng Chen, Rongjie Huang, Qinglin Zhang, Qian Chen, Xihao Li

Speaker diarization, the process of segmenting an audio stream or transcribed speech content into homogenous partitions based on speaker identity, plays a crucial role in the interpretation and analysis of human speech. Most existing speaker diarization systems rely exclusively on unimodal acoustic information, making the task particularly challenging due to the innate ambiguities of audio signals. Recent studies have made tremendous efforts towards audio-visual or audio-semantic modeling to enhance performance. However, even the incorporation of up to two modalities often falls short in addressing the complexities of spontaneous and unstructured conversations. To exploit more meaningful dialogue patterns, we propose a novel multimodal approach that jointly utilizes audio, visual, and semantic cues to enhance speaker diarization. Our method elegantly formulates the multimodal modeling as a constrained optimization problem. First, we build insights into the visual connections among active speakers and the semantic interactions within spoken content, thereby establishing abundant pairwise constraints. Then we introduce a joint pairwise constraint propagation algorithm to cluster speakers based on these visual and semantic constraints. This integration effectively leverages the complementary strengths of different modalities, refining the affinity estimation between individual speaker embeddings. Extensive experiments conducted on multiple multimodal datasets demonstrate that our approach consistently outperforms state-of-the-art speaker diarization methods.

📄 PDF Abstract BibTeX arXiv:2408.12102

Code (0)

등록된 구현이 없습니다.

Tasks

speaker-diarizationSpeaker Diarization

Similar Papers 제목 키워드 기반

Audio-Visual Speech Enhancement Using Multimodal Deep Convolutional Neural Networks

2017-03-30 · Jen-Cheng Hou, Syu-Siang Wang, Ying-Hui Lai, Yu Tsao 외

Speech enhancement (SE) aims to reduce noise in speech signals. Most SE techniques focus only on addressing audio information. In this work, inspired by multimodal learning, which utilizes data from different modalities,…

DecoderMulti-Task LearningSpeech Enhancement

Audio-Visual Speech Enhancement Using Multimodal Deep Convolutional Neural Networks

2017-09-01 · Jen-Cheng Hou, Syu-Siang Wang, Ying-Hui Lai, Yu Tsao 외

Speech enhancement (SE) aims to reduce noise in speech signals. Most SE techniques focus only on addressing audio information. In this work, inspired by multimodal learning, which utilizes data from different modalities,…

DecoderMulti-Task LearningSpeech Enhancement

SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context

2024-11-25 · Jungang Li, Sicheng Tao, Yibo Yan, Xiaojie Gu 외

Endeavors have been made to explore Large Language Models for video analysis (Video-LLMs), particularly in understanding and interpreting long videos. However, existing Video-LLMs still face challenges in effectively int…

Large Language ModelMMEVideo MMEVideo Understanding

Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics

2025-03-17 · CVPR 2025 1 · Chen Liu, Liying Yang, Peike Li, Dadong Wang 외

Sound-guided object segmentation has drawn considerable attention for its potential to enhance multimodal perception. Previous methods primarily focus on developing advanced architectures to facilitate effective audio-vi…

Semantic Segmentation

Frequency-Domain Decomposition and Recomposition for Robust Audio-Visual Segmentation

2025-09-23 · Yunzhe Shen, Kai Peng, Leiye Liu, Wei Ji 외 arxiv

Audio-visual segmentation (AVS) plays a critical role in multimodal machine learning by effectively integrating audio and visual cues to precisely segment objects or regions within visual scenes. Recent AVS methods have …