paper-with-me

Audio Classification 벤치마크

Audio Classification on ESC-50

59개 결과 · ⬇ CSV · JSON

Top-1 Accuracy

79.3 84.25 89.2 94.15 99.1 2017-05 2026-09 L3 — 79.3 (2017-05-23) L3 — 79.3 (2017-05-23) AVTS — 82.3 (2018-06-30) AVTS — 82.3 (2018-06-30) XDC — 85.4 (2019-11-28) XDC — 84.8 (2019-11-28) XDC — 85.4 (2019-11-28) XDC — 84.8 (2019-11-28) AVID — 89.2 (2020-04-27) AVID — 89.2 (2020-04-27) ACDNet — 87.1 (2021-03-05) ACDNet — 87.1 (2021-03-05) Multi-Format Contrastive — 90.5 (2021-03-11) Multi-Format Contrastive — 90.5 (2021-03-11) Audio Spectrogram Transformer — 95.7 (2021-04-05) Audio Spectrogram Transformer — 95.7 (2021-04-05) ERANN-2-5 — 96.1 (2021-06-03) ERANN-2-5 — 96.1 (2021-06-03) HTS-AT — 97.0 (2022-02-02) HTS-AT — 97.0 (2022-02-02) SepTr — 91.13 (2022-03-17) SepTr — 91.13 (2022-03-17) EAT-M — 96.3 (2022-04-25) EAT-S — 95.25 (2022-04-25) EAT-S (scratch) — 92.15 (2022-04-25) EAT-M — 96.3 (2022-04-25) EAT-S — 95.25 (2022-04-25) EAT-S (scratch) — 92.15 (2022-04-25) SepTr + LeRaC — 91.58 (2022-05-18) SepTr + LeRaC — 91.58 (2022-05-18) mn40_as — 97.45 (2022-11-09) mn40_as — 97.45 (2022-11-09) BEATs — 98.1 (2022-12-18) BEATs — 98.1 (2022-12-18) DyMN-L — 97.4 (2023-10-24) DyMN-L — 97.4 (2023-10-24) OmniVec — 98.4 (2023-11-07) OmniVec — 98.4 (2023-11-07) OmniVec2 — 99.1 (2024-01-01) OmniVec2 — 99.1 (2024-01-01) EAT — 96.0 (2024-01-07) EAT — 96.0 (2024-01-07) InternVideo2 — 98.6 (2024-03-22) InternVideo2 — 98.6 (2024-03-22) M2D-AS/0.7 — 97.2 (2024-04-09) M2D/0.7 — 96.0 (2024-04-09) M2D-AS/0.7 — 97.2 (2024-04-09) M2D/0.7 — 96.0 (2024-04-09) M2D-CLAP/0.7 — 97.4 (2024-06-04) M2D-CLAP/0.7 — 97.4 (2024-06-04) LHGNN — 96.2 (2025-01-07) LHGNN — 96.2 (2025-01-07) MATPAC (SSL model, linear eval) — 93.5 (2025-02-17) MATPAC (SSL model, linear eval) — 93.5 (2025-02-17) M2D2 AS+ — 98.5 (2025-03-28) M2D2 AS+ — 98.5 (2025-03-28) L3 — 79.3 (2017-05-23) AVTS — 82.3 (2018-06-30) XDC — 85.4 (2019-11-28) AVID — 89.2 (2020-04-27) Multi-Format Contrastive — 90.5 (2021-03-11) Audio Spectrogram Transformer — 95.7 (2021-04-05) ERANN-2-5 — 96.1 (2021-06-03) HTS-AT — 97.0 (2022-02-02) mn40_as — 97.45 (2022-11-09) BEATs — 98.1 (2022-12-18) OmniVec — 98.4 (2023-11-07) OmniVec2 — 99.1 (2024-01-01)
RankModel Top-1 AccuracyPRE-TRAINING DATASETAccuracy (5-fold) Extra Training Data PaperCodeYear
1 OmniVec2 99.1Multiple99.1 OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning 2024
2 InternVideo2 98.6Multiple98.6 InternVideo2: Scaling Foundation Models for Multimodal Video Understanding opengvlab/internvideo · opengvlab/internvideo2 2024
3 M2D2 AS+ 98.5AudioSet,WavCaps98.5 M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP nttcslab/m2d · nttcslab/eval-audio-repr 2025
4 OmniVec 98.4Multiple98.4 OmniVec: Learning robust representations with cross modal sharing 2023
5 BEATs 98.1AudioSet98.1 BEATs: Audio Pre-Training with Acoustic Tokenizers microsoft/unilm · Yui010206/CREMA · qingyuliu0521/icsd · +1 2022
6 mn40_as 97.45AudioSet97.45 Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge Distillation fschmid56/efficientat · fschmid56/efficientat_hear 2022
7 DyMN-L 97.4AudioSet97.4 Dynamic Convolutional Neural Networks as Efficient Pre-trained Audio Models fschmid56/efficientat 2023
7 M2D-CLAP/0.7 97.4AudioSet97.4 M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation nttcslab/m2d · nttcslab/eval-audio-repr 2024
9 M2D-AS/0.7 97.2AudioSet97.2 Masked Modeling Duo: Towards a Universal Audio Pre-training Framework nttcslab/m2d · nttcslab/eval-audio-repr 2024
10 HTS-AT 97.0AudioSet97.0 HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection retrocirce/hts-audio-transformer 2022
11 EAT-M 96.3AudioSet96.3 End-to-End Audio Strikes Back: Boosting Augmentations Towards An Efficient Audio Classification Network Alibaba-MIIL/AudioClassfication 2022
12 LHGNN 96.2 LHGNN: Local-Higher Order Graph Neural Networks For Audio Classification and Tagging 2025
13 ERANN-2-5 96.1AudioSet96.1 ERANNs: Efficient Residual Audio Neural Networks for Audio Pattern Recognition 2021
14 M2D/0.7 96.096.0 Masked Modeling Duo: Towards a Universal Audio Pre-training Framework nttcslab/m2d · nttcslab/eval-audio-repr 2024
14 EAT 96.0AudioSet96.0 EAT: Self-Supervised Pre-Training with Efficient Audio Transformer cwx-worst-one/eat 2024
16 Audio Spectrogram Transformer 95.7AudioSet, ImageNet95.7 AST: Audio Spectrogram Transformer YuanGongND/ast · nttcslab/composing-general-audio-repr · pxaris/ccml · +2 2021
17 EAT-S 95.25AudioSet95.25 End-to-End Audio Strikes Back: Boosting Augmentations Towards An Efficient Audio Classification Network Alibaba-MIIL/AudioClassfication 2022
18 MATPAC (SSL model, linear eval) 93.5AudioSet93.5 Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning aurianworld/matpac 2025
19 EAT-S (scratch) 92.1592.15 End-to-End Audio Strikes Back: Boosting Augmentations Towards An Efficient Audio Classification Network Alibaba-MIIL/AudioClassfication 2022
20 SepTr + LeRaC 91.5891.58 Learning Rate Curriculum croitorualin/lerac 2022
1–20 / 59 다음 → 페이지당 10 20 50 100