paper-with-me

Audio Classification 벤치마크

Audio Classification on AudioSet

102개 결과 · ⬇ CSV · JSON

Test mAP

0.244 0.3225 0.401 0.4795 0.558 2017-05 2026-09 L3 — 0.249 (2017-05-23) L3 — 0.249 (2017-05-23) Triplet — 0.244 (2017-11-06) Triplet — 0.244 (2017-11-06) AudioVisual Fusion Net — 0.462 (2020-05-29) AudioVisual Fusion Net — 0.462 (2020-05-29) MMV — 0.309 (2020-06-29) MMV — 0.309 (2020-06-29) WEANet-SUSTAIN — 0.398 (2020-06-30) WEANet-SUSTAIN — 0.398 (2020-06-30) PANNs-CNN14 (Single) — 0.431 (2020-08-23) PANNs-CNN14 (Single) — 0.431 (2020-08-23) PSLA (Ensemble) — 0.474 (2021-02-02) PSLA (Single) — 0.443 (2021-02-02) PSLA (Ensemble) — 0.474 (2021-02-02) PSLA (Single) — 0.443 (2021-02-02) Perceiver — 0.449 (2021-03-04) Perceiver — 0.449 (2021-03-04) Multi-Format Contrastive — 0.376 (2021-03-11) Multi-Format Contrastive — 0.376 (2021-03-11) AST (Ensemble) — 0.485 (2021-04-05) AST (Single) — 0.459 (2021-04-05) AST (Ensemble) — 0.485 (2021-04-05) AST (Single) — 0.459 (2021-04-05) VATT-Base — 0.394 (2021-04-22) VATT-Base — 0.394 (2021-04-22) ERANN-1-6 — 0.45 (2021-06-03) ERANN-1-6 — 0.45 (2021-06-03) MBT (AS-500K training + Video) — 0.496 (2021-06-30) MBT (AS-500K training + Video) — 0.496 (2021-06-30) PaSST (Ensemble) — 0.496 (2021-10-11) PaSST-S (Single) — 0.471 (2021-10-11) PaSST (Ensemble) — 0.496 (2021-10-11) PaSST-S (Single) — 0.471 (2021-10-11) Conformer (AS-2M) — 0.411 (2021-10-14) Conformer (AS-2M) — 0.411 (2021-10-14) HTS-AT (Ensemble) — 0.487 (2022-02-02) HTS-AT (Ensemble) — 0.487 (2022-02-02) EAT-M — 0.426 (2022-04-25) EAT-S — 0.405 (2022-04-25) EAT-M — 0.426 (2022-04-25) EAT-S — 0.405 (2022-04-25) UAVM (Audio + Video) — 0.504 (2022-07-29) UAVM (Audio + Video) — 0.504 (2022-07-29) CAV-MAE (Audio-Visual) — 0.512 (2022-10-02) CAV-MAE (Audio-Only) — 0.466 (2022-10-02) CAV-MAE (Visual-Only) — 0.262 (2022-10-02) CAV-MAE (Audio-Visual) — 0.512 (2022-10-02) CAV-MAE (Audio-Only) — 0.466 (2022-10-02) CAV-MAE (Visual-Only) — 0.262 (2022-10-02) PlayItBackX3 — 0.477 (2022-10-20) PlayItBackX3 — 0.477 (2022-10-20) mn40_as (Ensemble) — 0.498 (2022-11-09) mn40_as (Single) — 0.483 (2022-11-09) mn40_as (Ensemble) — 0.498 (2022-11-09) mn40_as (Single) — 0.483 (2022-11-09) Audiovisual Masked Autoencoder (Audiovisual, Single) — 0.518 (2022-12-09) Audiovisual Masked Autoencoder (Audio-only, Single) — 0.466 (2022-12-09) Audiovisual Masked Autoencoder (Audiovisual, Single) — 0.518 (2022-12-09) Audiovisual Masked Autoencoder (Audio-only, Single) — 0.466 (2022-12-09) BEATs (Audio-only, Ensemble) — 0.506 (2022-12-18) BEATs (Audio-only, Single) — 0.486 (2022-12-18) BEATs (Audio-only, Ensemble) — 0.506 (2022-12-18) BEATs (Audio-only, Single) — 0.486 (2022-12-18) ATST-C2F(Single) — 0.497 (2023-06-07) ATST-Frame — 0.48 (2023-06-07) ATST-C2F(Single) — 0.497 (2023-06-07) ATST-Frame — 0.48 (2023-06-07) DyMN-L (Audio-Only, Single) — 0.49 (2023-10-24) DyMN-L (Audio-Only, Single) — 0.49 (2023-10-24) OmniVec — 0.548 (2023-11-07) OmniVec — 0.548 (2023-11-07) OmniVec2 — 0.558 (2024-01-01) OmniVec2 — 0.558 (2024-01-01) EAT — 0.486 (2024-01-07) EAT — 0.486 (2024-01-07) EquiAV — 0.546 (2024-03-14) EquiAV — 0.546 (2024-03-14) DTF-AT (Single) — 0.486 (2024-03-24) DTF-AT (Single) — 0.486 (2024-03-24) M2D-AS/0.7 — 0.485 (2024-04-09) M2D/0.7 — 0.479 (2024-04-09) M2D-AS/0.7 — 0.485 (2024-04-09) M2D/0.7 — 0.479 (2024-04-09) MAX-AST (Single) — 0.481 (2024-04-14) MAX-AST (Single) — 0.481 (2024-04-14) M2D-CLAP/0.7 — 0.485 (2024-06-04) M2D-CLAP/0.7 — 0.485 (2024-06-04) DASS-Medium (Audio-only, single) — 0.476 (2024-07-04) DASS-Small (Audio-only, single) — 0.472 (2024-07-04) DASS-Medium (Audio-only, single) — 0.476 (2024-07-04) DASS-Small (Audio-only, single) — 0.472 (2024-07-04) M2D2 — 0.49 (2025-03-28) M2D2 — 0.49 (2025-03-28) SSLAM (Audio-Only, Single) — 0.502 (2025-06-13) SSLAM (Audio-Only, Single) — 0.502 (2025-06-13) L3 — 0.249 (2017-05-23) AudioVisual Fusion Net — 0.462 (2020-05-29) PSLA (Ensemble) — 0.474 (2021-02-02) AST (Ensemble) — 0.485 (2021-04-05) MBT (AS-500K training + Video) — 0.496 (2021-06-30) UAVM (Audio + Video) — 0.504 (2022-07-29) CAV-MAE (Audio-Visual) — 0.512 (2022-10-02) Audiovisual Masked Autoencoder (Audiovisual, Single) — 0.518 (2022-12-09) OmniVec — 0.548 (2023-11-07) OmniVec2 — 0.558 (2024-01-01)
RankModel Test mAPAUCd-prime Extra Training Data PaperCodeYear
1 OmniVec2 0.558 OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning 2024
2 OmniVec 0.548 OmniVec: Learning robust representations with cross modal sharing 2023
3 EquiAV 0.546 EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning jongsuk1/equiav 2024
4 MAViL (Audio-Visual, single) 0.533
5 Audiovisual Masked Autoencoder (Audiovisual, Single) 0.518 Audiovisual Masked Autoencoders google-research/scenic · google-research/scenic 2022
6 CAV-MAE (Audio-Visual) 0.512 Contrastive Audio-Visual Masked Autoencoder yuangongnd/cav-mae 2022
7 BEATs (Audio-only, Ensemble) 0.506 BEATs: Audio Pre-Training with Acoustic Tokenizers microsoft/unilm · Yui010206/CREMA · qingyuliu0521/icsd · +1 2022
8 UAVM (Audio + Video) 0.504 UAVM: Towards Unifying Audio and Visual Models YuanGongND/uavm 2022
9 SSLAM (Audio-Only, Single) 0.502 SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes ta012/SSLAM 2025
10 mn40_as (Ensemble) 0.498 Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge Distillation fschmid56/efficientat · fschmid56/efficientat_hear 2022
11 ATST-C2F(Single) 0.497 Self-supervised Audio Teacher-Student Transformer for Both Clip-level and Frame-level Tasks Audio-WestlakeU/ATST-SED · audio-westlakeu/audiossl 2023
12 MBT (AS-500K training + Video) 0.496 Attention Bottlenecks for Multimodal Fusion google-research/scenic 2021
12 PaSST (Ensemble) 0.496 Efficient Training of Audio Transformers with Patchout kkoutini/passt · kkoutini/passt_hear21 2021
14 DyMN-L (Audio-Only, Single) 0.490 Dynamic Convolutional Neural Networks as Efficient Pre-trained Audio Models fschmid56/efficientat 2023
14 M2D2 0.490 M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP nttcslab/m2d · nttcslab/eval-audio-repr 2025
16 HTS-AT (Ensemble) 0.487 HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection retrocirce/hts-audio-transformer 2022
17 BEATs (Audio-only, Single) 0.486 BEATs: Audio Pre-Training with Acoustic Tokenizers microsoft/unilm · Yui010206/CREMA · qingyuliu0521/icsd · +1 2022
17 EAT 0.486 EAT: Self-Supervised Pre-Training with Efficient Audio Transformer cwx-worst-one/eat 2024
17 DTF-AT (Single) 0.486 DTF-AT: Decoupled Time-Frequency Audio Transformer for Event Classification ta012/DTFAT 2024
20 AST (Ensemble) 0.485 AST: Audio Spectrogram Transformer YuanGongND/ast · nttcslab/composing-general-audio-repr · pxaris/ccml · +2 2021
1–20 / 102 다음 → 페이지당 10 20 50 100