paper-with-me

Papers Audio Source Separation

“Audio Source Separation” 태그가 달린 논문 117편 · 필터 해제

Audio Source Separation in Reverberant Environments using $β$-divergence based Nonnegative Factorization

2026-04-14 · Mahmoud Fakhry, Piergiorgio Svaizer, Maurizio Omologo arxiv

In Gaussian model-based multichannel audio source separation, the likelihood of observed mixtures of source signals is parametrized by source spectral variances and by associated spatial covariance matrices. These parame…

Audio Source Separation

A Knowledge-Driven Approach to Music Segmentation, Music Source Separation and Cinematic Audio Source Separation

2026-02-25 · Chun-wei Ho, Sabato Marco Siniscalchi, Kai Li, Chin-Hui Lee arxiv

We propose a knowledge-driven, model-based approach to segmenting audio into single-category and mixed-category chunks with applications to source separation. "Knowledge" here denotes information associated with the data…

Music Source SeparationAudio Source Separation

SAM Audio: Segment Anything in Audio

2025-12-19 · Bowen Shi, Andros Tjandra, John Hoffman, Helin Wang 외 arxiv

General audio source separation is a key capability for multimodal AI systems that can perceive and reason about sound. Despite substantial progress in recent years, existing separation models are either domain-specific,…

Audio Source Separation

Robustness of Minimum-Volume Nonnegative Matrix Factorization under an Expanded Sufficiently Scattered Condition

2025-11-06 · Giovanni Barbarino, Nicolas Gillis, Subhayan Saha arxiv

Minimum-volume nonnegative matrix factorization (min-vol NMF) has been used successfully in many applications, such as hyperspectral imaging, chemical kinetics, spectroscopy, topic modeling, and audio source separation. …

Audio Source Separation

On Temporal Guidance and Iterative Refinement in Audio Source Separation

2025-07-23 · Tobias Morocutti, Jonathan Greif, Paul Primus, Florian Schmid 외 arxiv

Spatial semantic segmentation of sound scenes (S5) involves the accurate identification of active sound classes and the precise separation of their sources from complex acoustic mixtures. Conventional systems rely on a t…

Audio Source SeparationSemantic SegmentationSound Event DetectionAudio Tagging

Towards Reliable Objective Evaluation Metrics for Generative Singing Voice Separation Models

2025-07-15 · Paul A. Bereuter, Benjamin Stahl, Mark D. Plumbley, Alois Sontacchi

Traditional Blind Source Separation Evaluation (BSS-Eval) metrics were originally designed to evaluate linear audio source separation models based on methods such as time-frequency masking. However, recent generative mod…

Audio Source Separationblind source separation

DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization

2025-06-03 · Geonyoung Lee, Geonhee Han, Paul Hongsuck Seo

Language-queried Audio Source Separation (LASS) enables open-vocabulary sound separation via natural language queries. While existing methods rely on task-specific training, we explore whether pretrained diffusion models…

Audio GenerationAudio Source SeparationNatural Language Queries

ZeroSep: Separate Anything in Audio with Zero Training

2025-05-29 · Chao Huang, Yuesheng Ma, Junxuan Huang, Susan Liang 외

Audio source separation is fundamental for machines to understand complex acoustic environments and underpins numerous audio applications. Current supervised deep learning approaches, while powerful, are limited by the n…

Audio Source SeparationDenoising

Text-Queried Audio Source Separation via Hierarchical Modeling

2025-05-27 · Xinlei Yin, Xiulian Peng, Xue Jiang, Zhiwei Xiong 외

Target audio source separation with natural language queries presents a promising paradigm for extracting arbitrary audio events through arbitrary text descriptions. Existing methods mainly face two challenges, the diffi…

Audio Source SeparationNatural Language Queries

Training-Free Multi-Step Audio Source Separation

2025-05-26 · Yongyi Zang, Jingyi Li, Qiuqiang Kong

Audio source separation aims to separate a mixture into target sources. Previous audio source separation systems usually conduct one-step inference, which does not fully explore the separation ability of models. In this …

Audio Source SeparationDenoisingMusic Source SeparationSpeech Enhancement

Score Distillation Sampling for Audio: Source Separation, Synthesis, and Beyond

2025-05-07 · Jessie Richter-Powell, Antonio Torralba, Jonathan Lorraine

We introduce Audio-SDS, a generalization of Score Distillation Sampling (SDS) to text-conditioned audio diffusion models. While SDS was initially designed for text-to-3D generation using image diffusion, its core idea of…

3D GenerationAudio Source SeparationText to 3D

Automatic Identification of Samples in Hip-Hop Music via Multi-Loss Training and an Artificial Dataset

2025-02-10 · Huw Cheston, Jan Van Balen, Simon Durand

Sampling, the practice of reusing recorded music or sounds from another source in a new work, is common in popular music genres like hip-hop and rap. Numerous services have emerged that allow users to identify connection…

Audio Source SeparationMetric Learning

Study of the Performance of CEEMDAN in Underdetermined Speech Separation

2024-11-18 · Rawad Melhem, Riad Hamadeh, Assef Jafar

The CEEMDAN algorithm is one of the modern methods used in the analysis of non-stationary signals. This research presents a study of the effectiveness of this method in audio source separation to know the limits of its w…

Audio Source SeparationSpeech Separation

Leveraging LLM and Text-Queried Separation for Noise-Robust Sound Event Detection

2024-11-02 · Han Yin, Yang Xiao, Jisheng Bai, Rohan Kumar Das

Sound Event Detection (SED) is challenging in noisy environments where overlapping sounds obscure target events. Language-queried audio source separation (LASS) aims to isolate the target sound events from a noisy clip. …

Audio Source SeparationEvent DetectionSound Event Detection

Task-Aware Unified Source Separation

2024-10-31 · Kohei Saijo, Janek Ebbers, François G. Germain, Gordon Wichern 외

Several attempts have been made to handle multiple source separation tasks such as speech enhancement, speech separation, sound event separation, music source separation (MSS), or cinematic audio source separation (CASS)…

Audio Source SeparationMusic Source SeparationSpeech EnhancementSpeech Separation

Exploring Text-Queried Sound Event Detection with Audio Source Separation

2024-09-20 · Han Yin, Jisheng Bai, Yang Xiao, Hui Wang 외

In sound event detection (SED), overlapping sound events pose a significant challenge, as certain events can be easily masked by background noise or other events, resulting in poor detection performance. To address this …

Audio Source SeparationEvent DetectionSound Event Detection

Unsupervised Composable Representations for Audio

2024-08-19 · Giovanni Bindi, Philippe Esling

Current generative models are able to generate high-quality artefacts but have been shown to struggle with compositional reasoning, which can be defined as the ability to generate complex structures from simpler elements…

Audio Source Separationblind source separationInductive BiasRepresentation Learning

Facing the Music: Tackling Singing Voice Separation in Cinematic Audio Source Separation

2024-08-07 · Karn N. Watcharasupat, Chih-Wei Wu, Iroro Orife

Cinematic audio source separation (CASS), as a standalone problem of extracting individual stems from their mixture, is a fairly new subtask of audio source separation. A typical setup of CASS is a three-stem problem, wi…

Audio Source SeparationDecoder

Remastering Divide and Remaster: A Cinematic Audio Source Separation Dataset with Multilingual Support

2024-07-09 · Karn N. Watcharasupat, Chih-Wei Wu, Iroro Orife

Cinematic audio source separation (CASS), as a problem of extracting the dialogue, music, and effects stems from their mixture, is a relatively new subtask of audio source separation. To date, only one publicly available…

Audio Source SeparationDiversity

Semantic Grouping Network for Audio Source Separation

2024-07-04 · Shentong Mo, Yapeng Tian

Recently, audio-visual separation approaches have taken advantage of the natural synchronization between the two modalities to boost audio source separation performance. They extracted high-level semantics from visual in…

Audio Source Separation
1–20 / 117 다음 →