{"task":"Speech Enhancement","dataset":"VoiceBank + DEMAND","metric_names":["PESQ (wb)","CBAK","COVL","CSIG","STOI","ESTOI","SSNR","SI-SDR"],"rows":[{"id":93932,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"ROSE-CD(PESQ)","metrics":{"CBAK":"3.37","COVL":"4.30","CSIG":"4.63","ESTOI":"0.83","PESQ (wb)":"3.99","Para. (M)":"65","SI-SDR":"0.40","SSNR":"0.927","STOI":"92.6"},"paper_url":"https://arxiv.org/abs/2507.05688v1","paper_title":"Robust One-step Speech Enhancement via Consistency Distillation","paper_date":"2025-07-08","code_links":[{"title":"LiangXu123/Robust-One-step-Speech-Enhancement-via-Consistency-Distillation-ROSE-CD-","url":"https://github.com/LiangXu123/Robust-One-step-Speech-Enhancement-via-Consistency-Distillation-ROSE-CD-"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93933,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"PESQetarian","metrics":{"CBAK":"2.49","COVL":"3.5","CSIG":"3.63","ESTOI":"0.84","PESQ (wb)":"3.82","Para. (M)":"30","SI-SDR":"-19.8","SSNR":"-2.72","STOI":"0.92"},"paper_url":"https://arxiv.org/abs/2406.03460v1","paper_title":"The PESQetarian: On the Relevance of Goodhart's Law for Speech Enhancement","paper_date":"2024-06-05","code_links":[],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93934,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"Mamba-SEUNet L (+PCS)","metrics":{"CBAK":"3.67","COVL":"4.40","CSIG":"4.82","PESQ (wb)":"3.73","Para. (M)":"6.28","STOI":"96"},"paper_url":"https://arxiv.org/abs/2412.16626v2","paper_title":"Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement","paper_date":"2024-12-21","code_links":[{"title":"MyParadise21/Mamba-SEUNet","url":"https://github.com/MyParadise21/Mamba-SEUNet"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93935,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"Schrödinger bridge (PESQ loss)","metrics":{"PESQ (wb)":"3.70"},"paper_url":"https://arxiv.org/abs/2409.10753v2","paper_title":"Investigating Training Objectives for Generative Speech Enhancement","paper_date":"2024-09-16","code_links":[{"title":"sp-uhh/sgmse","url":"https://github.com/sp-uhh/sgmse"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93936,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"SEMamba (+PCS)","metrics":{"CBAK":"3.63","COVL":"4.37","CSIG":"4.79","PESQ (wb)":"3.69","Para. (M)":"2.25","STOI":"96"},"paper_url":"https://arxiv.org/abs/2405.06573v1","paper_title":"An Investigation of Incorporating Mamba for Speech Enhancement","paper_date":"2024-05-10","code_links":[{"title":"roychao19477/semamba","url":"https://github.com/roychao19477/semamba"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93937,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"ZipEnhancer (S, \\lamba_6 = 0)","metrics":{"CBAK":"3.87","COVL":"4.36","CSIG":"4.81","PESQ (wb)":"3.63","Para. (M)":"2.04","SI-SDR":"19.09","SSNR":"8.33","STOI":"96.19"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93938,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"PrimeK-Net","metrics":{"CBAK":"3.98","COVL":"4.35","CSIG":"4.81","PESQ (wb)":"3.61","Para. (M)":"1.41","STOI":"96"},"paper_url":"https://arxiv.org/abs/2502.19906v1","paper_title":"PrimeK-Net: Multi-scale Spectral Learning via Group Prime-Kernel Convolutional Neural Networks for Single Channel Speech Enhancement","paper_date":"2025-02-27","code_links":[{"title":"huaidanquede/PrimeK-Net","url":"https://github.com/huaidanquede/PrimeK-Net"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93939,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"ZipEnhancer (S, \\lamba_6 = 0.2)","metrics":{"CBAK":"3.97","COVL":"4.35","CSIG":"4.81","PESQ (wb)":"3.61","Para. (M)":"2.04","SI-SDR":"19.96","SSNR":"10.01","STOI":"96.22"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93940,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"MP-SENet","metrics":{"CBAK":"3.99","COVL":"4.34","CSIG":"4.81","PESQ (wb)":"3.60","Para. (M)":"2.26","STOI":"0.96"},"paper_url":"https://arxiv.org/abs/2308.08926v2","paper_title":"Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement","paper_date":"2023-08-17","code_links":[{"title":"yxlu-0102/MP-SENet","url":"https://github.com/yxlu-0102/MP-SENet"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93941,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"PCS_CS_WAVLM","metrics":{"CBAK":"3.49","COVL":"4.20","CSIG":"4.75","PESQ (wb)":"3.54","STOI":"0.96"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93942,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"xLSTM-SENet2","metrics":{"CBAK":"3.98","COVL":"4.27","CSIG":"4.78","PESQ (wb)":"3.53","Para. (M)":"2.27","STOI":"0.96"},"paper_url":"https://arxiv.org/abs/2501.06146v2","paper_title":"xLSTM-SENet: xLSTM for Single-Channel Speech Enhancement","paper_date":"2025-01-10","code_links":[{"title":"nikolaikyhne/xlstm-senet","url":"https://github.com/nikolaikyhne/xlstm-senet"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93943,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"SCP-CMGAN","metrics":{"CBAK":"3.97","COVL":"4.25","CSIG":"4.75","PESQ (wb)":"3.52","SSNR":"10.82","STOI":"96"},"paper_url":"https://arxiv.org/abs/2210.14474v1","paper_title":"SCP-GAN: Self-Correcting Discriminator Optimization for Training Consistency Preserving Metric GAN on Speech Enhancement Tasks","paper_date":"2022-10-26","code_links":[],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93944,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"ROSE-CD","metrics":{"CBAK":"3.33","COVL":"4.04","CSIG":"4.523","ESTOI":"0.87","PESQ (wb)":"3.49","Para. (M)":"65","SI-SDR":"17.80","SSNR":"3.34","STOI":"94.73"},"paper_url":"https://arxiv.org/abs/2507.05688v1","paper_title":"Robust One-step Speech Enhancement via Consistency Distillation","paper_date":"2025-07-08","code_links":[{"title":"LiangXu123/Robust-One-step-Speech-Enhancement-via-Consistency-Distillation-ROSE-CD-","url":"https://github.com/LiangXu123/Robust-One-step-Speech-Enhancement-via-Consistency-Distillation-ROSE-CD-"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93945,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"D2Former","metrics":{"PESQ (wb)":"3.43","Para. (M)":"0.86"},"paper_url":"https://arxiv.org/abs/2102.01993v2","paper_title":"Monaural Speech Enhancement with Complex Convolutional Block Attention Module and Joint Time Frequency Losses","paper_date":"2021-02-03","code_links":[{"title":"modelscope/ClearerVoice-Studio","url":"https://github.com/modelscope/ClearerVoice-Studio"},{"title":"alibabasglab/frcrn","url":"https://github.com/alibabasglab/frcrn"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93946,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"CMGAN","metrics":{"CBAK":"3.94","COVL":"4.12","CSIG":"4.63","PESQ (wb)":"3.41","SSNR":"11.1","STOI":"96"},"paper_url":"https://arxiv.org/abs/2209.11112v3","paper_title":"CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement","paper_date":"2022-09-22","code_links":[{"title":"ruizhecao96/cmgan","url":"https://github.com/ruizhecao96/cmgan"},{"title":"SherifAbdulatif/CMGAN","url":"https://github.com/SherifAbdulatif/CMGAN"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93947,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"PCS","metrics":{"COVL":"3.92","CSIG":"4.43","PESQ (wb)":"3.35","STOI":"95"},"paper_url":"https://arxiv.org/abs/2203.17152v4","paper_title":"Perceptual Contrast Stretching on Target Feature for Speech Enhancement","paper_date":"2022-03-31","code_links":[{"title":"roychao19477/pcs","url":"https://github.com/roychao19477/pcs"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93948,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"D²Net","metrics":{"CBAK":"3.18","COVL":"3.92","CSIG":"4.63","PESQ (wb)":"3.27","STOI":"96"},"paper_url":"https://ieeexplore.ieee.org/abstract/document/9979863","paper_title":"D²Net: A Denoising and Dereverberation Network Based on Two-branch Encoder and Dual-path Transformer","paper_date":"2022-11-21","code_links":[],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93949,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"aTENNuate","metrics":{"CBAK":"2.85","COVL":"3.96","CSIG":"4.57","PESQ (wb)":"3.27","SI-SDR":"15.04"},"paper_url":"https://arxiv.org/abs/2409.03377v4","paper_title":"aTENNuate: Optimized Real-time Speech Enhancement with Deep SSMs on Raw Audio","paper_date":"2024-09-05","code_links":[],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93950,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"Centaurus (0.51M)","metrics":{"PESQ (wb)":"3.25"},"paper_url":"https://arxiv.org/abs/2501.13230v1","paper_title":"Let SSMs be ConvNets: State-space Modeling with Optimal Tensor Contractions","paper_date":"2025-01-22","code_links":[],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93951,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"MetricGAN-OKD","metrics":{"CBAK":"3.07","COVL":"3.73","CSIG":"4.23","PESQ (wb)":"3.24","Para. (M)":"1.89"},"paper_url":"https://proceedings.mlr.press/v202/shin23b.html","paper_title":"MetricGAN-OKD: Multi-Metric Optimization of MetricGAN via Online Knowledge Distillation for Speech Enhancement","paper_date":"2023-07-24","code_links":[{"title":"wooseok-shin/MetricGAN-OKD","url":"https://github.com/wooseok-shin/MetricGAN-OKD"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93952,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"MANNER","metrics":{"CBAK":"3.65","COVL":"3.91","CSIG":"4.53","PESQ (wb)":"3.21","STOI":"95"},"paper_url":"https://arxiv.org/abs/2203.02181v1","paper_title":"MANNER: Multi-view Attention Network for Noise Erasure","paper_date":"2022-03-04","code_links":[{"title":"winddori2002/MANNER","url":"https://github.com/winddori2002/MANNER"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93953,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"BSSE-SE","metrics":{"CBAK":"3.58","COVL":"3.88","CSIG":"4.52","PESQ (wb)":"3.20","STOI":"95.7"},"paper_url":"https://arxiv.org/abs/2204.03339v2","paper_title":"Boosting Self-Supervised Embeddings for Speech Enhancement","paper_date":"2022-04-07","code_links":[{"title":"khhungg/BSSE-SE","url":"https://github.com/khhungg/BSSE-SE"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93954,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"DeepFilterNet3","metrics":{"CBAK":"3.61","COVL":"3.77","CSIG":"4.34","PESQ (wb)":"3.17","STOI":"0.944"},"paper_url":"https://arxiv.org/abs/2305.08227v1","paper_title":"DeepFilterNet: Perceptually Motivated Real-Time Speech Enhancement","paper_date":"2023-05-14","code_links":[{"title":"rikorose/deepfilternet","url":"https://github.com/rikorose/deepfilternet"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93955,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"PERL-AE","metrics":{"CBAK":"3.53","COVL":"3.83","CSIG":"4.43","PESQ (wb)":"3.17"},"paper_url":"http://arxiv.org/abs/2010.11860v1","paper_title":"Perceptual Loss based Speech Denoising with an ensemble of Audio Pattern Recognition and Self-Supervised Models","paper_date":"2020-10-22","code_links":[{"title":"saurabh-kataria/PERL-samples","url":"https://github.com/saurabh-kataria/PERL-samples"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":93956,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"PFPL","metrics":{"CBAK":"3.60","COVL":"3.67","CSIG":"4.18","PESQ (wb)":"3.15"},"paper_url":"https://arxiv.org/abs/2010.15174v3","paper_title":"Improving Perceptual Quality by Phone-Fortified Perceptual Loss using Wasserstein Distance for Speech Enhancement","paper_date":"2020-10-28","code_links":[{"title":"aleXiehta/PhoneFortifiedPerceptualLoss","url":"https://github.com/aleXiehta/PhoneFortifiedPerceptualLoss"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93957,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"MetricGAN+","metrics":{"CBAK":"3.16","COVL":"3.64","CSIG":"4.14","PESQ (wb)":"3.15"},"paper_url":"https://arxiv.org/abs/2104.03538v2","paper_title":"MetricGAN+: An Improved Version of MetricGAN for Speech Enhancement","paper_date":"2021-04-08","code_links":[{"title":"speechbrain/speechbrain","url":"https://github.com/speechbrain/speechbrain/tree/develop/recipes/Voicebank/enhance/MetricGAN"},{"title":"JasonSWFu/MetricGAN","url":"https://github.com/JasonSWFu/MetricGAN"},{"title":"wooseok-shin/MetricGAN-plus-pytorch","url":"https://github.com/wooseok-shin/MetricGAN-plus-pytorch"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93958,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"MANNER-S + MV-AT (8.1GF)","metrics":{"CBAK":"3.61","COVL":"3.82","CSIG":"4.45","PESQ (wb)":"3.12","Para. (M)":"1.38","STOI":"95"},"paper_url":"https://arxiv.org/abs/2208.10367v2","paper_title":"Multi-View Attention Transfer for Efficient Speech Enhancement","paper_date":"2022-08-22","code_links":[],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93959,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"MetricGAN-OKD (Causal Arch.)","metrics":{"CBAK":"3.13","COVL":"3.64","CSIG":"4.17","PESQ (wb)":"3.12","Para. (M)":"0.82"},"paper_url":"https://proceedings.mlr.press/v202/shin23b.html","paper_title":"MetricGAN-OKD: Multi-Metric Optimization of MetricGAN via Online Knowledge Distillation for Speech Enhancement","paper_date":"2023-07-24","code_links":[{"title":"wooseok-shin/MetricGAN-OKD","url":"https://github.com/wooseok-shin/MetricGAN-OKD"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93960,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"SGMSE+","metrics":{"PESQ (wb)":"3.11"},"paper_url":"https://arxiv.org/abs/2402.00811v2","paper_title":"An Analysis of the Variance of Diffusion-based Speech Enhancement","paper_date":"2024-02-01","code_links":[],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93961,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"DEMUCS (H=64, S=2 ,U =2)","metrics":{"CBAK":"3.4","COVL":"3.63","CSIG":"4.31","PESQ (wb)":"3.07","STOI":"95"},"paper_url":"https://arxiv.org/abs/2006.12847v3","paper_title":"Real Time Speech Enhancement in the Waveform Domain","paper_date":"2020-06-23","code_links":[{"title":"facebookresearch/denoiser","url":"https://github.com/facebookresearch/denoiser"},{"title":"yunyangzeng/taploss","url":"https://github.com/yunyangzeng/taploss"},{"title":"jonashaag/paperswithcode-speech-enhancement-audiosamples","url":"https://github.com/jonashaag/paperswithcode-speech-enhancement-audiosamples/tree/master/Real%20Time%20Speech%20Enhancement%20in%20the%20Waveform%20Domain"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93962,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"Dense-TSNet","metrics":{"CBAK":"3.58","COVL":"3.86","CSIG":"4.51","PESQ (wb)":"3.05","Para. (M)":"0.014"},"paper_url":"https://arxiv.org/abs/2409.11725v1","paper_title":"Dense-TSNet: Dense Connected Two-Stage Structure for Ultra-Lightweight Speech Enhancement","paper_date":"2024-09-18","code_links":[],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93963,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"RDL-Net 3.91M (Deep Xi - MMSE-LSA)","metrics":{"CBAK":"3.43","COVL":"3.72","CSIG":"4.38","PESQ (wb)":"3.02"},"paper_url":"https://arxiv.org/abs/2002.12794v1","paper_title":"Deep Residual-Dense Lattice Network for Speech Enhancement","paper_date":"2020-02-27","code_links":[{"title":"nick-nikzad/RDL-SE","url":"https://github.com/nick-nikzad/RDL-SE"},{"title":"MindSpore-paper-code-2/code400","url":"https://github.com/MindSpore-paper-code-2/code400/tree/main/EDSR"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93964,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"ROSE","metrics":{"CBAK":"3.56","COVL":"3.72","CSIG":"4.47","PESQ (wb)":"3.01","Para. (M)":"36.98","STOI":"95"},"paper_url":"https://arxiv.org/abs/2312.06118v2","paper_title":"ROSE: A Recognition-Oriented Speech Enhancement Framework in Air Traffic Control Using Multi-Objective Learning","paper_date":"2023-12-11","code_links":[{"title":"xcyu-0903/rose","url":"https://github.com/xcyu-0903/rose"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93965,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"FSPEN","metrics":{"PESQ (wb)":"2.97","Para. (M)":"0.079","STOI":"0.942"},"paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=10446016","paper_title":"FSPEN: AN ULTRA-LIGHTWEIGHT NETWORK FOR REAL TIME SPEECH ENAHNCMENT","paper_date":"2024-04-15","code_links":[{"title":"gitwukeyi/FSPEN","url":"https://github.com/gitwukeyi/FSPEN"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93966,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"RDL-Net 3.91M (Deep Xi - SRWF)","metrics":{"CBAK":"3.35","COVL":"3.67","CSIG":"4.36","PESQ (wb)":"2.94"},"paper_url":"https://arxiv.org/abs/2002.12794v1","paper_title":"Deep Residual-Dense Lattice Network for Speech Enhancement","paper_date":"2020-02-27","code_links":[{"title":"nick-nikzad/RDL-SE","url":"https://github.com/nick-nikzad/RDL-SE"},{"title":"MindSpore-paper-code-2/code400","url":"https://github.com/MindSpore-paper-code-2/code400/tree/main/EDSR"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93967,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"RDL-Net 1.87M (Deep Xi - MMSE-LSA)","metrics":{"CBAK":"3.32","COVL":"3.62","CSIG":"4.29","PESQ (wb)":"2.93"},"paper_url":"https://arxiv.org/abs/2002.12794v1","paper_title":"Deep Residual-Dense Lattice Network for Speech Enhancement","paper_date":"2020-02-27","code_links":[{"title":"nick-nikzad/RDL-SE","url":"https://github.com/nick-nikzad/RDL-SE"},{"title":"MindSpore-paper-code-2/code400","url":"https://github.com/MindSpore-paper-code-2/code400/tree/main/EDSR"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93968,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"Causal DEMUCS (H=48,S=4, U =4)","metrics":{"CBAK":"3.25","COVL":"3.52","CSIG":"4.22","PESQ (wb)":"2.93","STOI":"95"},"paper_url":"https://arxiv.org/abs/2006.12847v3","paper_title":"Real Time Speech Enhancement in the Waveform Domain","paper_date":"2020-06-23","code_links":[{"title":"facebookresearch/denoiser","url":"https://github.com/facebookresearch/denoiser"},{"title":"yunyangzeng/taploss","url":"https://github.com/yunyangzeng/taploss"},{"title":"jonashaag/paperswithcode-speech-enhancement-audiosamples","url":"https://github.com/jonashaag/paperswithcode-speech-enhancement-audiosamples/tree/master/Real%20Time%20Speech%20Enhancement%20in%20the%20Waveform%20Domain"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93969,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"SGMSE+ (Diffusion Model)","metrics":{"PESQ (wb)":"2.93"},"paper_url":"https://arxiv.org/abs/2208.05830v2","paper_title":"Speech Enhancement and Dereverberation with Diffusion-based Generative Models","paper_date":"2022-08-11","code_links":[{"title":"sp-uhh/sgmse","url":"https://github.com/sp-uhh/sgmse"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93970,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"MetricGAN","metrics":{"CBAK":"3.18","COVL":"3.42","CSIG":"3.99","PESQ (wb)":"2.86"},"paper_url":"https://arxiv.org/abs/1905.04874v1","paper_title":"MetricGAN: Generative Adversarial Networks based Black-box Metric Scores Optimization for Speech Enhancement","paper_date":"2019-05-13","code_links":[{"title":"anicolson/DeepXi","url":"https://github.com/anicolson/DeepXi"},{"title":"JasonSWFu/MetricGAN","url":"https://github.com/JasonSWFu/MetricGAN"},{"title":"nick-nikzad/RDL-SE","url":"https://github.com/nick-nikzad/RDL-SE"},{"title":"somvy/MetricGAN","url":"https://github.com/somvy/MetricGAN"},{"title":"unfinity-core/MetricGAN","url":"https://github.com/unfinity-core/MetricGAN"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93971,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"RDL-Net 1.87M (Deep Xi - SRWF)","metrics":{"CBAK":"3.23","COVL":"3.56","CSIG":"4.27","PESQ (wb)":"2.84"},"paper_url":"https://arxiv.org/abs/2002.12794v1","paper_title":"Deep Residual-Dense Lattice Network for Speech Enhancement","paper_date":"2020-02-27","code_links":[{"title":"nick-nikzad/RDL-SE","url":"https://github.com/nick-nikzad/RDL-SE"},{"title":"MindSpore-paper-code-2/code400","url":"https://github.com/MindSpore-paper-code-2/code400/tree/main/EDSR"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93972,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"real-time-GRU","metrics":{"PESQ (wb)":"2.82"},"paper_url":"https://arxiv.org/abs/2102.07330v1","paper_title":"A Modulation-Domain Loss for Neural-Network-based Real-time Speech Enhancement","paper_date":"2021-02-15","code_links":[{"title":"tvuong123/ModulationDomainLoss","url":"https://github.com/tvuong123/ModulationDomainLoss"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":93973,"task":"Speech Enhancement","parent_task":null,"dataset":"VoiceBank + DEMAND","model_name":"DCT","metrics":{"CBAK":"3.29","COVL":"3.29","CSIG":"3.9","PESQ (wb)":"2.7"},"paper_url":"https://arxiv.org/abs/1910.07840v4","paper_title":"End-to-end speech enhancement based on discrete cosine transform","paper_date":"2019-10-17","code_links":[{"title":"BYRTIMO/END-TO-END-SPEECH-ENHANCEMENT-BASED-ON-DISCRETE-COSINE-TRANSFORM","url":"https://github.com/BYRTIMO/END-TO-END-SPEECH-ENHANCEMENT-BASED-ON-DISCRETE-COSINE-TRANSFORM"},{"title":"IMLHF/DRUnet-SE","url":"https://github.com/IMLHF/DRUnet-SE"},{"title":"BYRTIMO/Speech-enhancement-based-on-amplitude-symmetric-transform","url":"https://github.com/BYRTIMO/Speech-enhancement-based-on-amplitude-symmetric-transform"}],"metrics_order":"[\"PESQ (wb)\", \"CBAK\", \"COVL\", \"CSIG\", \"STOI\", \"ESTOI\", \"SSNR\", \"SI-SDR\", \"Para. (M)\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]}]}