paper-with-me

Audio Classification 벤치마크

Audio Classification on AudioSet

102개 결과 · ⬇ CSV · JSON

Test mAP

0.244 0.3225 0.401 0.4795 0.558 2017-05 2026-09 L3 — 0.249 (2017-05-23) L3 — 0.249 (2017-05-23) Triplet — 0.244 (2017-11-06) Triplet — 0.244 (2017-11-06) AudioVisual Fusion Net — 0.462 (2020-05-29) AudioVisual Fusion Net — 0.462 (2020-05-29) MMV — 0.309 (2020-06-29) MMV — 0.309 (2020-06-29) WEANet-SUSTAIN — 0.398 (2020-06-30) WEANet-SUSTAIN — 0.398 (2020-06-30) PANNs-CNN14 (Single) — 0.431 (2020-08-23) PANNs-CNN14 (Single) — 0.431 (2020-08-23) PSLA (Ensemble) — 0.474 (2021-02-02) PSLA (Single) — 0.443 (2021-02-02) PSLA (Ensemble) — 0.474 (2021-02-02) PSLA (Single) — 0.443 (2021-02-02) Perceiver — 0.449 (2021-03-04) Perceiver — 0.449 (2021-03-04) Multi-Format Contrastive — 0.376 (2021-03-11) Multi-Format Contrastive — 0.376 (2021-03-11) AST (Ensemble) — 0.485 (2021-04-05) AST (Single) — 0.459 (2021-04-05) AST (Ensemble) — 0.485 (2021-04-05) AST (Single) — 0.459 (2021-04-05) VATT-Base — 0.394 (2021-04-22) VATT-Base — 0.394 (2021-04-22) ERANN-1-6 — 0.45 (2021-06-03) ERANN-1-6 — 0.45 (2021-06-03) MBT (AS-500K training + Video) — 0.496 (2021-06-30) MBT (AS-500K training + Video) — 0.496 (2021-06-30) PaSST (Ensemble) — 0.496 (2021-10-11) PaSST-S (Single) — 0.471 (2021-10-11) PaSST (Ensemble) — 0.496 (2021-10-11) PaSST-S (Single) — 0.471 (2021-10-11) Conformer (AS-2M) — 0.411 (2021-10-14) Conformer (AS-2M) — 0.411 (2021-10-14) HTS-AT (Ensemble) — 0.487 (2022-02-02) HTS-AT (Ensemble) — 0.487 (2022-02-02) EAT-M — 0.426 (2022-04-25) EAT-S — 0.405 (2022-04-25) EAT-M — 0.426 (2022-04-25) EAT-S — 0.405 (2022-04-25) UAVM (Audio + Video) — 0.504 (2022-07-29) UAVM (Audio + Video) — 0.504 (2022-07-29) CAV-MAE (Audio-Visual) — 0.512 (2022-10-02) CAV-MAE (Audio-Only) — 0.466 (2022-10-02) CAV-MAE (Visual-Only) — 0.262 (2022-10-02) CAV-MAE (Audio-Visual) — 0.512 (2022-10-02) CAV-MAE (Audio-Only) — 0.466 (2022-10-02) CAV-MAE (Visual-Only) — 0.262 (2022-10-02) PlayItBackX3 — 0.477 (2022-10-20) PlayItBackX3 — 0.477 (2022-10-20) mn40_as (Ensemble) — 0.498 (2022-11-09) mn40_as (Single) — 0.483 (2022-11-09) mn40_as (Ensemble) — 0.498 (2022-11-09) mn40_as (Single) — 0.483 (2022-11-09) Audiovisual Masked Autoencoder (Audiovisual, Single) — 0.518 (2022-12-09) Audiovisual Masked Autoencoder (Audio-only, Single) — 0.466 (2022-12-09) Audiovisual Masked Autoencoder (Audiovisual, Single) — 0.518 (2022-12-09) Audiovisual Masked Autoencoder (Audio-only, Single) — 0.466 (2022-12-09) BEATs (Audio-only, Ensemble) — 0.506 (2022-12-18) BEATs (Audio-only, Single) — 0.486 (2022-12-18) BEATs (Audio-only, Ensemble) — 0.506 (2022-12-18) BEATs (Audio-only, Single) — 0.486 (2022-12-18) ATST-C2F(Single) — 0.497 (2023-06-07) ATST-Frame — 0.48 (2023-06-07) ATST-C2F(Single) — 0.497 (2023-06-07) ATST-Frame — 0.48 (2023-06-07) DyMN-L (Audio-Only, Single) — 0.49 (2023-10-24) DyMN-L (Audio-Only, Single) — 0.49 (2023-10-24) OmniVec — 0.548 (2023-11-07) OmniVec — 0.548 (2023-11-07) OmniVec2 — 0.558 (2024-01-01) OmniVec2 — 0.558 (2024-01-01) EAT — 0.486 (2024-01-07) EAT — 0.486 (2024-01-07) EquiAV — 0.546 (2024-03-14) EquiAV — 0.546 (2024-03-14) DTF-AT (Single) — 0.486 (2024-03-24) DTF-AT (Single) — 0.486 (2024-03-24) M2D-AS/0.7 — 0.485 (2024-04-09) M2D/0.7 — 0.479 (2024-04-09) M2D-AS/0.7 — 0.485 (2024-04-09) M2D/0.7 — 0.479 (2024-04-09) MAX-AST (Single) — 0.481 (2024-04-14) MAX-AST (Single) — 0.481 (2024-04-14) M2D-CLAP/0.7 — 0.485 (2024-06-04) M2D-CLAP/0.7 — 0.485 (2024-06-04) DASS-Medium (Audio-only, single) — 0.476 (2024-07-04) DASS-Small (Audio-only, single) — 0.472 (2024-07-04) DASS-Medium (Audio-only, single) — 0.476 (2024-07-04) DASS-Small (Audio-only, single) — 0.472 (2024-07-04) M2D2 — 0.49 (2025-03-28) M2D2 — 0.49 (2025-03-28) SSLAM (Audio-Only, Single) — 0.502 (2025-06-13) SSLAM (Audio-Only, Single) — 0.502 (2025-06-13) L3 — 0.249 (2017-05-23) AudioVisual Fusion Net — 0.462 (2020-05-29) PSLA (Ensemble) — 0.474 (2021-02-02) AST (Ensemble) — 0.485 (2021-04-05) MBT (AS-500K training + Video) — 0.496 (2021-06-30) UAVM (Audio + Video) — 0.504 (2022-07-29) CAV-MAE (Audio-Visual) — 0.512 (2022-10-02) Audiovisual Masked Autoencoder (Audiovisual, Single) — 0.518 (2022-12-09) OmniVec — 0.548 (2023-11-07) OmniVec2 — 0.558 (2024-01-01)
RankModel Test mAPAUCd-prime Extra Training Data PaperCodeYear
20 M2D-CLAP/0.7 0.485 M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation nttcslab/m2d · nttcslab/eval-audio-repr 2024
20 M2D-AS/0.7 0.485 Masked Modeling Duo: Towards a Universal Audio Pre-training Framework nttcslab/m2d · nttcslab/eval-audio-repr 2024
23 MAViL (Audio-only, single) 0.484
24 mn40_as (Single) 0.483 Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge Distillation fschmid56/efficientat · fschmid56/efficientat_hear 2022
25 MAX-AST (Single) 0.481 MAX-AST: COMBINING CONVOLUTION, LOCAL AND GLOBAL SELF-ATTENTIONS FOR AUDIO EVENT CLASSIFICATION ta012/MaxAST 2024
26 ATST-Frame 0.480 Self-supervised Audio Teacher-Student Transformer for Both Clip-level and Frame-level Tasks Audio-WestlakeU/ATST-SED · audio-westlakeu/audiossl 2023
27 M2D/0.7 0.479 Masked Modeling Duo: Towards a Universal Audio Pre-training Framework nttcslab/m2d · nttcslab/eval-audio-repr 2024
28 PlayItBackX3 0.477 Play It Back: Iterative Attention for Audio Recognition alexandrosstergiou/PlayItBack 2022
29 DASS-Medium (Audio-only, single) 0.476 DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners Saurabhbhati/DASS 2024
30 PSLA (Ensemble) 0.4740.9812.936 PSLA: Improving Audio Tagging with Pretraining, Sampling, Labeling, and Aggregation YuanGongND/psla 2021
31 DASS-Small (Audio-only, single) 0.472 DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners Saurabhbhati/DASS 2024
32 PaSST-S (Single) 0.471 Efficient Training of Audio Transformers with Patchout kkoutini/passt · kkoutini/passt_hear21 2021
32 MaskSpec (AS-2M) 0.471
34 CAV-MAE (Audio-Only) 0.466 Contrastive Audio-Visual Masked Autoencoder yuangongnd/cav-mae 2022
34 Audiovisual Masked Autoencoder (Audio-only, Single) 0.466 Audiovisual Masked Autoencoders google-research/scenic · google-research/scenic 2022
36 AudioVisual Fusion Net 0.4620.975 Large Scale Audiovisual Learning of Sounds with Weakly Labeled Data 2020
37 AST (Single) 0.459 AST: Audio Spectrogram Transformer YuanGongND/ast · nttcslab/composing-general-audio-repr · pxaris/ccml · +2 2021
38 ERANN-1-6 0.4500.9762.804 ERANNs: Efficient Residual Audio Neural Networks for Audio Pattern Recognition 2021
39 Perceiver 0.449 Perceiver: General Perception with Iterative Attention deepmind/deepmind-research · towhee-io/towhee · lucidrains/perceiver-pytorch · +9 2021
40 PSLA (Single) 0.4430.9752.778 PSLA: Improving Audio Tagging with Pretraining, Sampling, Labeling, and Aggregation YuanGongND/psla 2021
← 이전 21–40 / 102 다음 → 페이지당 10 20 50 100