paper-with-me

Audio Classification 벤치마크

Audio Classification on ESC-50

59개 결과 · ⬇ CSV · JSON

Top-1 Accuracy

79.3 84.25 89.2 94.15 99.1 2017-05 2026-09 L3 — 79.3 (2017-05-23) L3 — 79.3 (2017-05-23) AVTS — 82.3 (2018-06-30) AVTS — 82.3 (2018-06-30) XDC — 85.4 (2019-11-28) XDC — 84.8 (2019-11-28) XDC — 85.4 (2019-11-28) XDC — 84.8 (2019-11-28) AVID — 89.2 (2020-04-27) AVID — 89.2 (2020-04-27) ACDNet — 87.1 (2021-03-05) ACDNet — 87.1 (2021-03-05) Multi-Format Contrastive — 90.5 (2021-03-11) Multi-Format Contrastive — 90.5 (2021-03-11) Audio Spectrogram Transformer — 95.7 (2021-04-05) Audio Spectrogram Transformer — 95.7 (2021-04-05) ERANN-2-5 — 96.1 (2021-06-03) ERANN-2-5 — 96.1 (2021-06-03) HTS-AT — 97.0 (2022-02-02) HTS-AT — 97.0 (2022-02-02) SepTr — 91.13 (2022-03-17) SepTr — 91.13 (2022-03-17) EAT-M — 96.3 (2022-04-25) EAT-S — 95.25 (2022-04-25) EAT-S (scratch) — 92.15 (2022-04-25) EAT-M — 96.3 (2022-04-25) EAT-S — 95.25 (2022-04-25) EAT-S (scratch) — 92.15 (2022-04-25) SepTr + LeRaC — 91.58 (2022-05-18) SepTr + LeRaC — 91.58 (2022-05-18) mn40_as — 97.45 (2022-11-09) mn40_as — 97.45 (2022-11-09) BEATs — 98.1 (2022-12-18) BEATs — 98.1 (2022-12-18) DyMN-L — 97.4 (2023-10-24) DyMN-L — 97.4 (2023-10-24) OmniVec — 98.4 (2023-11-07) OmniVec — 98.4 (2023-11-07) OmniVec2 — 99.1 (2024-01-01) OmniVec2 — 99.1 (2024-01-01) EAT — 96.0 (2024-01-07) EAT — 96.0 (2024-01-07) InternVideo2 — 98.6 (2024-03-22) InternVideo2 — 98.6 (2024-03-22) M2D-AS/0.7 — 97.2 (2024-04-09) M2D/0.7 — 96.0 (2024-04-09) M2D-AS/0.7 — 97.2 (2024-04-09) M2D/0.7 — 96.0 (2024-04-09) M2D-CLAP/0.7 — 97.4 (2024-06-04) M2D-CLAP/0.7 — 97.4 (2024-06-04) LHGNN — 96.2 (2025-01-07) LHGNN — 96.2 (2025-01-07) MATPAC (SSL model, linear eval) — 93.5 (2025-02-17) MATPAC (SSL model, linear eval) — 93.5 (2025-02-17) M2D2 AS+ — 98.5 (2025-03-28) M2D2 AS+ — 98.5 (2025-03-28) L3 — 79.3 (2017-05-23) AVTS — 82.3 (2018-06-30) XDC — 85.4 (2019-11-28) AVID — 89.2 (2020-04-27) Multi-Format Contrastive — 90.5 (2021-03-11) Audio Spectrogram Transformer — 95.7 (2021-04-05) ERANN-2-5 — 96.1 (2021-06-03) HTS-AT — 97.0 (2022-02-02) mn40_as — 97.45 (2022-11-09) BEATs — 98.1 (2022-12-18) OmniVec — 98.4 (2023-11-07) OmniVec2 — 99.1 (2024-01-01)
RankModel Top-1 AccuracyPRE-TRAINING DATASETAccuracy (5-fold) Extra Training Data PaperCodeYear
21 SepTr 91.13- SepTr: Separable Transformer for Audio Spectrogram Processing ristea/septr 2022
22 Multi-Format Contrastive 90.5 Multi-Format Contrastive Learning of Audio Representations 2021
23 Multi-Channel Audio Feature with CNN 89.5EfficientNet89.5
24 AVID 89.2 Audio-Visual Instance Discrimination with Cross-Modal Agreement facebookresearch/AVID-CMA 2020
25 ACDNet 87.187.1 Environmental Sound Classification on the Edge: A Pipeline for Deep Acoustic Networks on Extremely Resource-Constrained Devices mohaimenz/acdnet 2021
26 XDC 85.4IG-Random Self-Supervised Learning by Cross-Modal Audio-Video Clustering HumamAlwassel/XDC 2019
27 XDC 84.8AudioSet Self-Supervised Learning by Cross-Modal Audio-Video Clustering HumamAlwassel/XDC 2019
28 AVTS 82.3 Cooperative Learning of Audio and Video Models from Self-Supervised Synchronization 2018
29 L3 79.3 Look, Listen and Learn marl/l3embedding 2017
30 OmniVec2 99.1Multiple99.1 OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning 2024
31 InternVideo2 98.6Multiple98.6 InternVideo2: Scaling Foundation Models for Multimodal Video Understanding opengvlab/internvideo · opengvlab/internvideo2 2024
32 M2D2 AS+ 98.5AudioSet,WavCaps98.5 M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP nttcslab/m2d · nttcslab/eval-audio-repr 2025
33 OmniVec 98.4Multiple98.4 OmniVec: Learning robust representations with cross modal sharing 2023
34 BEATs 98.1AudioSet98.1 BEATs: Audio Pre-Training with Acoustic Tokenizers microsoft/unilm · Yui010206/CREMA · qingyuliu0521/icsd · +1 2022
35 mn40_as 97.45AudioSet97.45 Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge Distillation fschmid56/efficientat · fschmid56/efficientat_hear 2022
36 DyMN-L 97.4AudioSet97.4 Dynamic Convolutional Neural Networks as Efficient Pre-trained Audio Models fschmid56/efficientat 2023
36 M2D-CLAP/0.7 97.4AudioSet97.4 M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation nttcslab/m2d · nttcslab/eval-audio-repr 2024
38 M2D-AS/0.7 97.2AudioSet97.2 Masked Modeling Duo: Towards a Universal Audio Pre-training Framework nttcslab/m2d · nttcslab/eval-audio-repr 2024
39 HTS-AT 97.0AudioSet97.0 HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection retrocirce/hts-audio-transformer 2022
40 EAT-M 96.3AudioSet96.3 End-to-End Audio Strikes Back: Boosting Augmentations Towards An Efficient Audio Classification Network Alibaba-MIIL/AudioClassfication 2022
← 이전 21–40 / 59 다음 → 페이지당 10 20 50 100