{"task":"Audio Classification","dataset":"AudioSet","metric_names":["Test mAP","AUC","d-prime"],"rows":[{"id":41279,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"OmniVec2","metrics":{"Test mAP":"0.558"},"paper_url":"http://openaccess.thecvf.com//content/CVPR2024/html/Srivastava_OmniVec2_-_A_Novel_Transformer_based_Network_for_Large_Scale_CVPR_2024_paper.html","paper_title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","paper_date":"2024-01-01","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41280,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"OmniVec","metrics":{"Test mAP":"0.548"},"paper_url":"https://arxiv.org/abs/2311.05709v1","paper_title":"OmniVec: Learning robust representations with cross modal sharing","paper_date":"2023-11-07","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41281,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"EquiAV","metrics":{"Test mAP":"0.546"},"paper_url":"https://arxiv.org/abs/2403.09502v2","paper_title":"EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning","paper_date":"2024-03-14","code_links":[{"title":"jongsuk1/equiav","url":"https://github.com/jongsuk1/equiav"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41282,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"MAViL (Audio-Visual, single)","metrics":{"Test mAP":"0.533"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41283,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"Audiovisual Masked Autoencoder (Audiovisual, Single)","metrics":{"Test mAP":"0.518"},"paper_url":"https://arxiv.org/abs/2212.05922v3","paper_title":"Audiovisual Masked Autoencoders","paper_date":"2022-12-09","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/av_mae"},{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41284,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"CAV-MAE (Audio-Visual)","metrics":{"Test mAP":"0.512"},"paper_url":"https://arxiv.org/abs/2210.07839v4","paper_title":"Contrastive Audio-Visual Masked Autoencoder","paper_date":"2022-10-02","code_links":[{"title":"yuangongnd/cav-mae","url":"https://github.com/yuangongnd/cav-mae"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41285,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"BEATs (Audio-only, Ensemble)","metrics":{"Test mAP":"0.506"},"paper_url":"https://arxiv.org/abs/2212.09058v1","paper_title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","paper_date":"2022-12-18","code_links":[{"title":"microsoft/unilm","url":"https://github.com/microsoft/unilm/tree/master/beats"},{"title":"Yui010206/CREMA","url":"https://github.com/Yui010206/CREMA"},{"title":"qingyuliu0521/icsd","url":"https://github.com/qingyuliu0521/icsd"},{"title":"phuriches/genrepasd","url":"https://github.com/phuriches/genrepasd"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41286,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"UAVM (Audio + Video)","metrics":{"Test mAP":"0.504"},"paper_url":"https://arxiv.org/abs/2208.00061v2","paper_title":"UAVM: Towards Unifying Audio and Visual Models","paper_date":"2022-07-29","code_links":[{"title":"YuanGongND/uavm","url":"https://github.com/YuanGongND/uavm"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41287,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"SSLAM (Audio-Only, Single)","metrics":{"Test mAP":"0.502"},"paper_url":"https://arxiv.org/abs/2506.12222v1","paper_title":"SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes","paper_date":"2025-06-13","code_links":[{"title":"ta012/SSLAM","url":"https://github.com/ta012/SSLAM"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41288,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"mn40_as (Ensemble)","metrics":{"Test mAP":"0.498"},"paper_url":"https://arxiv.org/abs/2211.04772v3","paper_title":"Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge Distillation","paper_date":"2022-11-09","code_links":[{"title":"fschmid56/efficientat","url":"https://github.com/fschmid56/efficientat"},{"title":"fschmid56/efficientat_hear","url":"https://github.com/fschmid56/efficientat_hear"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41289,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"ATST-C2F(Single)","metrics":{"Test mAP":"0.497"},"paper_url":"https://arxiv.org/abs/2306.04186v2","paper_title":"Self-supervised Audio Teacher-Student Transformer for Both Clip-level and Frame-level Tasks","paper_date":"2023-06-07","code_links":[{"title":"Audio-WestlakeU/ATST-SED","url":"https://github.com/Audio-WestlakeU/ATST-SED"},{"title":"audio-westlakeu/audiossl","url":"https://github.com/audio-westlakeu/audiossl"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41290,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"MBT (AS-500K training + Video)","metrics":{"Test mAP":"0.496"},"paper_url":"https://arxiv.org/abs/2107.00135v3","paper_title":"Attention Bottlenecks for Multimodal Fusion","paper_date":"2021-06-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/mbt"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41291,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"PaSST (Ensemble)","metrics":{"Test mAP":"0.496"},"paper_url":"https://arxiv.org/abs/2110.05069v3","paper_title":"Efficient Training of Audio Transformers with Patchout","paper_date":"2021-10-11","code_links":[{"title":"kkoutini/passt","url":"https://github.com/kkoutini/passt"},{"title":"kkoutini/passt_hear21","url":"https://github.com/kkoutini/passt_hear21"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41292,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"DyMN-L (Audio-Only, Single)","metrics":{"Test mAP":"0.490"},"paper_url":"https://arxiv.org/abs/2310.15648v1","paper_title":"Dynamic Convolutional Neural Networks as Efficient Pre-trained Audio Models","paper_date":"2023-10-24","code_links":[{"title":"fschmid56/efficientat","url":"https://github.com/fschmid56/efficientat"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41293,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"M2D2","metrics":{"Test mAP":"0.490"},"paper_url":"https://arxiv.org/abs/2503.22104v1","paper_title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","paper_date":"2025-03-28","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41294,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"HTS-AT (Ensemble)","metrics":{"Test mAP":"0.487"},"paper_url":"https://arxiv.org/abs/2202.00874v1","paper_title":"HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection","paper_date":"2022-02-02","code_links":[{"title":"retrocirce/hts-audio-transformer","url":"https://github.com/retrocirce/hts-audio-transformer"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41295,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"BEATs (Audio-only, Single)","metrics":{"Test mAP":"0.486"},"paper_url":"https://arxiv.org/abs/2212.09058v1","paper_title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","paper_date":"2022-12-18","code_links":[{"title":"microsoft/unilm","url":"https://github.com/microsoft/unilm/tree/master/beats"},{"title":"Yui010206/CREMA","url":"https://github.com/Yui010206/CREMA"},{"title":"qingyuliu0521/icsd","url":"https://github.com/qingyuliu0521/icsd"},{"title":"phuriches/genrepasd","url":"https://github.com/phuriches/genrepasd"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41296,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"EAT","metrics":{"Test mAP":"0.486"},"paper_url":"https://arxiv.org/abs/2401.03497v1","paper_title":"EAT: Self-Supervised Pre-Training with Efficient Audio Transformer","paper_date":"2024-01-07","code_links":[{"title":"cwx-worst-one/eat","url":"https://github.com/cwx-worst-one/eat"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41297,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"DTF-AT (Single)","metrics":{"Test mAP":"0.486"},"paper_url":"https://ojs.aaai.org/index.php/AAAI/article/view/29716","paper_title":"DTF-AT: Decoupled Time-Frequency Audio Transformer for Event Classification","paper_date":"2024-03-24","code_links":[{"title":"ta012/DTFAT","url":"https://github.com/ta012/DTFAT"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41298,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"AST (Ensemble)","metrics":{"Test mAP":"0.485"},"paper_url":"https://arxiv.org/abs/2104.01778v3","paper_title":"AST: Audio Spectrogram Transformer","paper_date":"2021-04-05","code_links":[{"title":"YuanGongND/ast","url":"https://github.com/YuanGongND/ast"},{"title":"nttcslab/composing-general-audio-repr","url":"https://github.com/nttcslab/composing-general-audio-repr"},{"title":"pxaris/ccml","url":"https://github.com/pxaris/ccml"},{"title":"cgaroufis/msspt","url":"https://github.com/cgaroufis/msspt"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/audio_spectrogram_transformer"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41299,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"M2D-CLAP/0.7","metrics":{"Test mAP":"0.485"},"paper_url":"https://arxiv.org/abs/2406.02032v1","paper_title":"M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation","paper_date":"2024-06-04","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41300,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"M2D-AS/0.7","metrics":{"Test mAP":"0.485"},"paper_url":"https://arxiv.org/abs/2404.06095v1","paper_title":"Masked Modeling Duo: Towards a Universal Audio Pre-training Framework","paper_date":"2024-04-09","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41301,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"MAViL (Audio-only, single)","metrics":{"Test mAP":"0.484"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41302,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"mn40_as (Single)","metrics":{"Test mAP":"0.483"},"paper_url":"https://arxiv.org/abs/2211.04772v3","paper_title":"Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge Distillation","paper_date":"2022-11-09","code_links":[{"title":"fschmid56/efficientat","url":"https://github.com/fschmid56/efficientat"},{"title":"fschmid56/efficientat_hear","url":"https://github.com/fschmid56/efficientat_hear"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41303,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"MAX-AST (Single)","metrics":{"Test mAP":"0.481"},"paper_url":"https://cmsworkshops.com/ICASSP2024/view_paper.php?PaperNum=7388","paper_title":"MAX-AST: COMBINING CONVOLUTION, LOCAL AND GLOBAL SELF-ATTENTIONS FOR AUDIO EVENT CLASSIFICATION","paper_date":"2024-04-14","code_links":[{"title":"ta012/MaxAST","url":"https://github.com/ta012/MaxAST"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41304,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"ATST-Frame","metrics":{"Test mAP":"0.480"},"paper_url":"https://arxiv.org/abs/2306.04186v2","paper_title":"Self-supervised Audio Teacher-Student Transformer for Both Clip-level and Frame-level Tasks","paper_date":"2023-06-07","code_links":[{"title":"Audio-WestlakeU/ATST-SED","url":"https://github.com/Audio-WestlakeU/ATST-SED"},{"title":"audio-westlakeu/audiossl","url":"https://github.com/audio-westlakeu/audiossl"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41305,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"M2D/0.7","metrics":{"Test mAP":"0.479"},"paper_url":"https://arxiv.org/abs/2404.06095v1","paper_title":"Masked Modeling Duo: Towards a Universal Audio Pre-training Framework","paper_date":"2024-04-09","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41306,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"PlayItBackX3","metrics":{"Test mAP":"0.477"},"paper_url":"https://arxiv.org/abs/2210.11328v2","paper_title":"Play It Back: Iterative Attention for Audio Recognition","paper_date":"2022-10-20","code_links":[{"title":"alexandrosstergiou/PlayItBack","url":"https://github.com/alexandrosstergiou/PlayItBack"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41307,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"DASS-Medium (Audio-only, single)","metrics":{"Test mAP":"0.476"},"paper_url":"https://arxiv.org/abs/2407.04082v2","paper_title":"DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners","paper_date":"2024-07-04","code_links":[{"title":"Saurabhbhati/DASS","url":"https://github.com/Saurabhbhati/DASS"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41308,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"PSLA (Ensemble)","metrics":{"AUC":"0.981","Test mAP":"0.474","d-prime":"2.936"},"paper_url":"https://arxiv.org/abs/2102.01243v3","paper_title":"PSLA: Improving Audio Tagging with Pretraining, Sampling, Labeling, and Aggregation","paper_date":"2021-02-02","code_links":[{"title":"YuanGongND/psla","url":"https://github.com/YuanGongND/psla"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41309,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"DASS-Small (Audio-only, single)","metrics":{"Test mAP":"0.472"},"paper_url":"https://arxiv.org/abs/2407.04082v2","paper_title":"DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners","paper_date":"2024-07-04","code_links":[{"title":"Saurabhbhati/DASS","url":"https://github.com/Saurabhbhati/DASS"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41310,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"PaSST-S (Single)","metrics":{"Test mAP":"0.471"},"paper_url":"https://arxiv.org/abs/2110.05069v3","paper_title":"Efficient Training of Audio Transformers with Patchout","paper_date":"2021-10-11","code_links":[{"title":"kkoutini/passt","url":"https://github.com/kkoutini/passt"},{"title":"kkoutini/passt_hear21","url":"https://github.com/kkoutini/passt_hear21"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41311,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"MaskSpec (AS-2M)","metrics":{"Test mAP":"0.471"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41312,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"CAV-MAE (Audio-Only)","metrics":{"Test mAP":"0.466"},"paper_url":"https://arxiv.org/abs/2210.07839v4","paper_title":"Contrastive Audio-Visual Masked Autoencoder","paper_date":"2022-10-02","code_links":[{"title":"yuangongnd/cav-mae","url":"https://github.com/yuangongnd/cav-mae"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41313,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"Audiovisual Masked Autoencoder (Audio-only, Single)","metrics":{"Test mAP":"0.466"},"paper_url":"https://arxiv.org/abs/2212.05922v3","paper_title":"Audiovisual Masked Autoencoders","paper_date":"2022-12-09","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/av_mae"},{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41314,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"AudioVisual Fusion Net","metrics":{"AUC":"0.975","Test mAP":"0.462"},"paper_url":"https://arxiv.org/abs/2006.01595v1","paper_title":"Large Scale Audiovisual Learning of Sounds with Weakly Labeled Data","paper_date":"2020-05-29","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41315,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"AST (Single)","metrics":{"Test mAP":"0.459"},"paper_url":"https://arxiv.org/abs/2104.01778v3","paper_title":"AST: Audio Spectrogram Transformer","paper_date":"2021-04-05","code_links":[{"title":"YuanGongND/ast","url":"https://github.com/YuanGongND/ast"},{"title":"nttcslab/composing-general-audio-repr","url":"https://github.com/nttcslab/composing-general-audio-repr"},{"title":"pxaris/ccml","url":"https://github.com/pxaris/ccml"},{"title":"cgaroufis/msspt","url":"https://github.com/cgaroufis/msspt"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/audio_spectrogram_transformer"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41316,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"ERANN-1-6","metrics":{"AUC":"0.976","Test mAP":"0.450","d-prime":"2.804"},"paper_url":"https://arxiv.org/abs/2106.01621v7","paper_title":"ERANNs: Efficient Residual Audio Neural Networks for Audio Pattern Recognition","paper_date":"2021-06-03","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41317,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"Perceiver","metrics":{"Test mAP":"0.449"},"paper_url":"https://arxiv.org/abs/2103.03206v2","paper_title":"Perceiver: General Perception with Iterative Attention","paper_date":"2021-03-04","code_links":[{"title":"deepmind/deepmind-research","url":"https://github.com/deepmind/deepmind-research/tree/master/perceiver"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"lucidrains/perceiver-pytorch","url":"https://github.com/lucidrains/perceiver-pytorch"},{"title":"krasserm/perceiver-io","url":"https://github.com/krasserm/perceiver-io"},{"title":"Rishit-dagli/Perceiver","url":"https://github.com/Rishit-dagli/Perceiver"},{"title":"louislva/deepmind-perceiver","url":"https://github.com/louislva/deepmind-perceiver"},{"title":"Xianchao-Wu/perceiver-pytorch","url":"https://github.com/Xianchao-Wu/perceiver-pytorch"},{"title":"fac2003/perceiver-multi-modality-pytorch","url":"https://github.com/fac2003/perceiver-multi-modality-pytorch"},{"title":"sooheon/perceiver-jax","url":"https://github.com/sooheon/perceiver-jax"},{"title":"clementpoiret/Perceiver_MNIST","url":"https://github.com/clementpoiret/Perceiver_MNIST"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-1/perceiver"},{"title":"kietngt00/hmdb51-recognition","url":"https://github.com/kietngt00/hmdb51-recognition"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41318,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"PSLA (Single)","metrics":{"AUC":"0.975","Test mAP":"0.443","d-prime":"2.778"},"paper_url":"https://arxiv.org/abs/2102.01243v3","paper_title":"PSLA: Improving Audio Tagging with Pretraining, Sampling, Labeling, and Aggregation","paper_date":"2021-02-02","code_links":[{"title":"YuanGongND/psla","url":"https://github.com/YuanGongND/psla"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41319,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"PANNs-CNN14 (Single)","metrics":{"AUC":"0.973","Test mAP":"0.431","d-prime":"2.732"},"paper_url":"http://arxiv.org/abs/1912.10211v5","paper_title":"PANNs: Large-Scale Pretrained Audio Neural Networks for Audio Pattern Recognition","paper_date":"2020-08-23","code_links":[{"title":"PaddlePaddle/PaddleSpeech","url":"https://github.com/PaddlePaddle/PaddleSpeech"},{"title":"qiuqiangkong/audioset_tagging_cnn","url":"https://github.com/qiuqiangkong/audioset_tagging_cnn"},{"title":"google-research/leaf-audio","url":"https://github.com/google-research/leaf-audio"},{"title":"gudgud96/frechet-audio-distance","url":"https://github.com/gudgud96/frechet-audio-distance"},{"title":"yinkalario/General-Purpose-Sound-Recognition-Demo","url":"https://github.com/yinkalario/General-Purpose-Sound-Recognition-Demo"},{"title":"YuanGongND/psla","url":"https://github.com/YuanGongND/psla"},{"title":"nttcslab/composing-general-audio-repr","url":"https://github.com/nttcslab/composing-general-audio-repr"},{"title":"sithu31296/audio-tagging","url":"https://github.com/sithu31296/audio-tagging"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41320,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"EAT-M","metrics":{"Test mAP":"0.426"},"paper_url":"https://arxiv.org/abs/2204.11479v5","paper_title":"End-to-End Audio Strikes Back: Boosting Augmentations Towards An Efficient Audio Classification Network","paper_date":"2022-04-25","code_links":[{"title":"Alibaba-MIIL/AudioClassfication","url":"https://github.com/Alibaba-MIIL/AudioClassfication"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41321,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"Conformer (AS-2M)","metrics":{"Test mAP":"0.411"},"paper_url":"https://arxiv.org/abs/2110.07313v3","paper_title":"Conformer-Based Self-Supervised Learning for Non-Speech Audio Tasks","paper_date":"2021-10-14","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41322,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"EAT-S","metrics":{"Test mAP":"0.405"},"paper_url":"https://arxiv.org/abs/2204.11479v5","paper_title":"End-to-End Audio Strikes Back: Boosting Augmentations Towards An Efficient Audio Classification Network","paper_date":"2022-04-25","code_links":[{"title":"Alibaba-MIIL/AudioClassfication","url":"https://github.com/Alibaba-MIIL/AudioClassfication"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41323,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"WEANet-SUSTAIN","metrics":{"AUC":"0.972","Test mAP":"0.398"},"paper_url":"https://arxiv.org/abs/2007.00144v1","paper_title":"A Sequential Self Teaching Approach for Improving Generalization in Sound Event Recognition","paper_date":"2020-06-30","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41324,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"VATT-Base","metrics":{"AUC":"0.971","Test mAP":"0.394","d-prime":"2.895"},"paper_url":"https://arxiv.org/abs/2104.11178v3","paper_title":"VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text","paper_date":"2021-04-22","code_links":[{"title":"google-research/google-research","url":"https://github.com/google-research/google-research/tree/master/vatt"},{"title":"akashe/ProgrammingInterview","url":"https://github.com/akashe/ProgrammingInterview"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/3/vat"},{"title":"MindCode-4/code-9","url":"https://github.com/MindCode-4/code-9/tree/main/vat"},{"title":"MindCode-4/code-13","url":"https://github.com/MindCode-4/code-13/tree/main/vat"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41325,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"Multi-Format Contrastive","metrics":{"Test mAP":"0.376"},"paper_url":"https://arxiv.org/abs/2103.06508v3","paper_title":"Multi-Format Contrastive Learning of Audio Representations","paper_date":"2021-03-11","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41326,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"MMV","metrics":{"Test mAP":"0.309"},"paper_url":"https://arxiv.org/abs/2006.16228v2","paper_title":"Self-Supervised MultiModal Versatile Networks","paper_date":"2020-06-29","code_links":[{"title":"deepmind/deepmind-research","url":"https://github.com/deepmind/deepmind-research/tree/master/mmv"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41327,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"CAV-MAE (Visual-Only)","metrics":{"Test mAP":"0.262"},"paper_url":"https://arxiv.org/abs/2210.07839v4","paper_title":"Contrastive Audio-Visual Masked Autoencoder","paper_date":"2022-10-02","code_links":[{"title":"yuangongnd/cav-mae","url":"https://github.com/yuangongnd/cav-mae"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":41328,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"L3","metrics":{"Test mAP":"0.249"},"paper_url":"http://arxiv.org/abs/1705.08168v2","paper_title":"Look, Listen and Learn","paper_date":"2017-05-23","code_links":[{"title":"marl/l3embedding","url":"https://github.com/marl/l3embedding"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":41329,"task":"Audio Classification","parent_task":null,"dataset":"AudioSet","model_name":"Triplet","metrics":{"Test mAP":"0.244"},"paper_url":"http://arxiv.org/abs/1711.02209v1","paper_title":"Unsupervised Learning of Semantic Audio Representations","paper_date":"2017-11-06","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122922,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"OmniVec2","metrics":{"Test mAP":"0.558"},"paper_url":"http://openaccess.thecvf.com//content/CVPR2024/html/Srivastava_OmniVec2_-_A_Novel_Transformer_based_Network_for_Large_Scale_CVPR_2024_paper.html","paper_title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","paper_date":"2024-01-01","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122923,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"OmniVec","metrics":{"Test mAP":"0.548"},"paper_url":"https://arxiv.org/abs/2311.05709v1","paper_title":"OmniVec: Learning robust representations with cross modal sharing","paper_date":"2023-11-07","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122924,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"EquiAV","metrics":{"Test mAP":"0.546"},"paper_url":"https://arxiv.org/abs/2403.09502v2","paper_title":"EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning","paper_date":"2024-03-14","code_links":[{"title":"jongsuk1/equiav","url":"https://github.com/jongsuk1/equiav"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122925,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"MAViL (Audio-Visual, single)","metrics":{"Test mAP":"0.533"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122926,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"Audiovisual Masked Autoencoder (Audiovisual, Single)","metrics":{"Test mAP":"0.518"},"paper_url":"https://arxiv.org/abs/2212.05922v3","paper_title":"Audiovisual Masked Autoencoders","paper_date":"2022-12-09","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/av_mae"},{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122927,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"CAV-MAE (Audio-Visual)","metrics":{"Test mAP":"0.512"},"paper_url":"https://arxiv.org/abs/2210.07839v4","paper_title":"Contrastive Audio-Visual Masked Autoencoder","paper_date":"2022-10-02","code_links":[{"title":"yuangongnd/cav-mae","url":"https://github.com/yuangongnd/cav-mae"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122928,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"BEATs (Audio-only, Ensemble)","metrics":{"Test mAP":"0.506"},"paper_url":"https://arxiv.org/abs/2212.09058v1","paper_title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","paper_date":"2022-12-18","code_links":[{"title":"microsoft/unilm","url":"https://github.com/microsoft/unilm/tree/master/beats"},{"title":"Yui010206/CREMA","url":"https://github.com/Yui010206/CREMA"},{"title":"qingyuliu0521/icsd","url":"https://github.com/qingyuliu0521/icsd"},{"title":"phuriches/genrepasd","url":"https://github.com/phuriches/genrepasd"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122929,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"UAVM (Audio + Video)","metrics":{"Test mAP":"0.504"},"paper_url":"https://arxiv.org/abs/2208.00061v2","paper_title":"UAVM: Towards Unifying Audio and Visual Models","paper_date":"2022-07-29","code_links":[{"title":"YuanGongND/uavm","url":"https://github.com/YuanGongND/uavm"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122930,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"SSLAM (Audio-Only, Single)","metrics":{"Test mAP":"0.502"},"paper_url":"https://arxiv.org/abs/2506.12222v1","paper_title":"SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes","paper_date":"2025-06-13","code_links":[{"title":"ta012/SSLAM","url":"https://github.com/ta012/SSLAM"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122931,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"mn40_as (Ensemble)","metrics":{"Test mAP":"0.498"},"paper_url":"https://arxiv.org/abs/2211.04772v3","paper_title":"Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge Distillation","paper_date":"2022-11-09","code_links":[{"title":"fschmid56/efficientat","url":"https://github.com/fschmid56/efficientat"},{"title":"fschmid56/efficientat_hear","url":"https://github.com/fschmid56/efficientat_hear"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122932,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"ATST-C2F(Single)","metrics":{"Test mAP":"0.497"},"paper_url":"https://arxiv.org/abs/2306.04186v2","paper_title":"Self-supervised Audio Teacher-Student Transformer for Both Clip-level and Frame-level Tasks","paper_date":"2023-06-07","code_links":[{"title":"Audio-WestlakeU/ATST-SED","url":"https://github.com/Audio-WestlakeU/ATST-SED"},{"title":"audio-westlakeu/audiossl","url":"https://github.com/audio-westlakeu/audiossl"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122933,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"MBT (AS-500K training + Video)","metrics":{"Test mAP":"0.496"},"paper_url":"https://arxiv.org/abs/2107.00135v3","paper_title":"Attention Bottlenecks for Multimodal Fusion","paper_date":"2021-06-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/mbt"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122934,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"PaSST (Ensemble)","metrics":{"Test mAP":"0.496"},"paper_url":"https://arxiv.org/abs/2110.05069v3","paper_title":"Efficient Training of Audio Transformers with Patchout","paper_date":"2021-10-11","code_links":[{"title":"kkoutini/passt","url":"https://github.com/kkoutini/passt"},{"title":"kkoutini/passt_hear21","url":"https://github.com/kkoutini/passt_hear21"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122935,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"DyMN-L (Audio-Only, Single)","metrics":{"Test mAP":"0.490"},"paper_url":"https://arxiv.org/abs/2310.15648v1","paper_title":"Dynamic Convolutional Neural Networks as Efficient Pre-trained Audio Models","paper_date":"2023-10-24","code_links":[{"title":"fschmid56/efficientat","url":"https://github.com/fschmid56/efficientat"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122936,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"M2D2","metrics":{"Test mAP":"0.490"},"paper_url":"https://arxiv.org/abs/2503.22104v1","paper_title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","paper_date":"2025-03-28","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122937,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"HTS-AT (Ensemble)","metrics":{"Test mAP":"0.487"},"paper_url":"https://arxiv.org/abs/2202.00874v1","paper_title":"HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection","paper_date":"2022-02-02","code_links":[{"title":"retrocirce/hts-audio-transformer","url":"https://github.com/retrocirce/hts-audio-transformer"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122938,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"BEATs (Audio-only, Single)","metrics":{"Test mAP":"0.486"},"paper_url":"https://arxiv.org/abs/2212.09058v1","paper_title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","paper_date":"2022-12-18","code_links":[{"title":"microsoft/unilm","url":"https://github.com/microsoft/unilm/tree/master/beats"},{"title":"Yui010206/CREMA","url":"https://github.com/Yui010206/CREMA"},{"title":"qingyuliu0521/icsd","url":"https://github.com/qingyuliu0521/icsd"},{"title":"phuriches/genrepasd","url":"https://github.com/phuriches/genrepasd"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122939,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"EAT","metrics":{"Test mAP":"0.486"},"paper_url":"https://arxiv.org/abs/2401.03497v1","paper_title":"EAT: Self-Supervised Pre-Training with Efficient Audio Transformer","paper_date":"2024-01-07","code_links":[{"title":"cwx-worst-one/eat","url":"https://github.com/cwx-worst-one/eat"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122940,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"DTF-AT (Single)","metrics":{"Test mAP":"0.486"},"paper_url":"https://ojs.aaai.org/index.php/AAAI/article/view/29716","paper_title":"DTF-AT: Decoupled Time-Frequency Audio Transformer for Event Classification","paper_date":"2024-03-24","code_links":[{"title":"ta012/DTFAT","url":"https://github.com/ta012/DTFAT"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122941,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"AST (Ensemble)","metrics":{"Test mAP":"0.485"},"paper_url":"https://arxiv.org/abs/2104.01778v3","paper_title":"AST: Audio Spectrogram Transformer","paper_date":"2021-04-05","code_links":[{"title":"YuanGongND/ast","url":"https://github.com/YuanGongND/ast"},{"title":"nttcslab/composing-general-audio-repr","url":"https://github.com/nttcslab/composing-general-audio-repr"},{"title":"pxaris/ccml","url":"https://github.com/pxaris/ccml"},{"title":"cgaroufis/msspt","url":"https://github.com/cgaroufis/msspt"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/audio_spectrogram_transformer"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122942,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"M2D-CLAP/0.7","metrics":{"Test mAP":"0.485"},"paper_url":"https://arxiv.org/abs/2406.02032v1","paper_title":"M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation","paper_date":"2024-06-04","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122943,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"M2D-AS/0.7","metrics":{"Test mAP":"0.485"},"paper_url":"https://arxiv.org/abs/2404.06095v1","paper_title":"Masked Modeling Duo: Towards a Universal Audio Pre-training Framework","paper_date":"2024-04-09","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122944,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"MAViL (Audio-only, single)","metrics":{"Test mAP":"0.484"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122945,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"mn40_as (Single)","metrics":{"Test mAP":"0.483"},"paper_url":"https://arxiv.org/abs/2211.04772v3","paper_title":"Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge Distillation","paper_date":"2022-11-09","code_links":[{"title":"fschmid56/efficientat","url":"https://github.com/fschmid56/efficientat"},{"title":"fschmid56/efficientat_hear","url":"https://github.com/fschmid56/efficientat_hear"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122946,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"MAX-AST (Single)","metrics":{"Test mAP":"0.481"},"paper_url":"https://cmsworkshops.com/ICASSP2024/view_paper.php?PaperNum=7388","paper_title":"MAX-AST: COMBINING CONVOLUTION, LOCAL AND GLOBAL SELF-ATTENTIONS FOR AUDIO EVENT CLASSIFICATION","paper_date":"2024-04-14","code_links":[{"title":"ta012/MaxAST","url":"https://github.com/ta012/MaxAST"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122947,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"ATST-Frame","metrics":{"Test mAP":"0.480"},"paper_url":"https://arxiv.org/abs/2306.04186v2","paper_title":"Self-supervised Audio Teacher-Student Transformer for Both Clip-level and Frame-level Tasks","paper_date":"2023-06-07","code_links":[{"title":"Audio-WestlakeU/ATST-SED","url":"https://github.com/Audio-WestlakeU/ATST-SED"},{"title":"audio-westlakeu/audiossl","url":"https://github.com/audio-westlakeu/audiossl"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122948,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"M2D/0.7","metrics":{"Test mAP":"0.479"},"paper_url":"https://arxiv.org/abs/2404.06095v1","paper_title":"Masked Modeling Duo: Towards a Universal Audio Pre-training Framework","paper_date":"2024-04-09","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122949,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"PlayItBackX3","metrics":{"Test mAP":"0.477"},"paper_url":"https://arxiv.org/abs/2210.11328v2","paper_title":"Play It Back: Iterative Attention for Audio Recognition","paper_date":"2022-10-20","code_links":[{"title":"alexandrosstergiou/PlayItBack","url":"https://github.com/alexandrosstergiou/PlayItBack"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122950,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"DASS-Medium (Audio-only, single)","metrics":{"Test mAP":"0.476"},"paper_url":"https://arxiv.org/abs/2407.04082v2","paper_title":"DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners","paper_date":"2024-07-04","code_links":[{"title":"Saurabhbhati/DASS","url":"https://github.com/Saurabhbhati/DASS"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122951,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"PSLA (Ensemble)","metrics":{"AUC":"0.981","Test mAP":"0.474","d-prime":"2.936"},"paper_url":"https://arxiv.org/abs/2102.01243v3","paper_title":"PSLA: Improving Audio Tagging with Pretraining, Sampling, Labeling, and Aggregation","paper_date":"2021-02-02","code_links":[{"title":"YuanGongND/psla","url":"https://github.com/YuanGongND/psla"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122952,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"DASS-Small (Audio-only, single)","metrics":{"Test mAP":"0.472"},"paper_url":"https://arxiv.org/abs/2407.04082v2","paper_title":"DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners","paper_date":"2024-07-04","code_links":[{"title":"Saurabhbhati/DASS","url":"https://github.com/Saurabhbhati/DASS"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122953,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"PaSST-S (Single)","metrics":{"Test mAP":"0.471"},"paper_url":"https://arxiv.org/abs/2110.05069v3","paper_title":"Efficient Training of Audio Transformers with Patchout","paper_date":"2021-10-11","code_links":[{"title":"kkoutini/passt","url":"https://github.com/kkoutini/passt"},{"title":"kkoutini/passt_hear21","url":"https://github.com/kkoutini/passt_hear21"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122954,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"MaskSpec (AS-2M)","metrics":{"Test mAP":"0.471"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122955,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"CAV-MAE (Audio-Only)","metrics":{"Test mAP":"0.466"},"paper_url":"https://arxiv.org/abs/2210.07839v4","paper_title":"Contrastive Audio-Visual Masked Autoencoder","paper_date":"2022-10-02","code_links":[{"title":"yuangongnd/cav-mae","url":"https://github.com/yuangongnd/cav-mae"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122956,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"Audiovisual Masked Autoencoder (Audio-only, Single)","metrics":{"Test mAP":"0.466"},"paper_url":"https://arxiv.org/abs/2212.05922v3","paper_title":"Audiovisual Masked Autoencoders","paper_date":"2022-12-09","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/av_mae"},{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122957,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"AudioVisual Fusion Net","metrics":{"AUC":"0.975","Test mAP":"0.462"},"paper_url":"https://arxiv.org/abs/2006.01595v1","paper_title":"Large Scale Audiovisual Learning of Sounds with Weakly Labeled Data","paper_date":"2020-05-29","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122958,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"AST (Single)","metrics":{"Test mAP":"0.459"},"paper_url":"https://arxiv.org/abs/2104.01778v3","paper_title":"AST: Audio Spectrogram Transformer","paper_date":"2021-04-05","code_links":[{"title":"YuanGongND/ast","url":"https://github.com/YuanGongND/ast"},{"title":"nttcslab/composing-general-audio-repr","url":"https://github.com/nttcslab/composing-general-audio-repr"},{"title":"pxaris/ccml","url":"https://github.com/pxaris/ccml"},{"title":"cgaroufis/msspt","url":"https://github.com/cgaroufis/msspt"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/audio_spectrogram_transformer"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122959,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"ERANN-1-6","metrics":{"AUC":"0.976","Test mAP":"0.450","d-prime":"2.804"},"paper_url":"https://arxiv.org/abs/2106.01621v7","paper_title":"ERANNs: Efficient Residual Audio Neural Networks for Audio Pattern Recognition","paper_date":"2021-06-03","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122960,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"Perceiver","metrics":{"Test mAP":"0.449"},"paper_url":"https://arxiv.org/abs/2103.03206v2","paper_title":"Perceiver: General Perception with Iterative Attention","paper_date":"2021-03-04","code_links":[{"title":"deepmind/deepmind-research","url":"https://github.com/deepmind/deepmind-research/tree/master/perceiver"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"lucidrains/perceiver-pytorch","url":"https://github.com/lucidrains/perceiver-pytorch"},{"title":"krasserm/perceiver-io","url":"https://github.com/krasserm/perceiver-io"},{"title":"Rishit-dagli/Perceiver","url":"https://github.com/Rishit-dagli/Perceiver"},{"title":"louislva/deepmind-perceiver","url":"https://github.com/louislva/deepmind-perceiver"},{"title":"Xianchao-Wu/perceiver-pytorch","url":"https://github.com/Xianchao-Wu/perceiver-pytorch"},{"title":"fac2003/perceiver-multi-modality-pytorch","url":"https://github.com/fac2003/perceiver-multi-modality-pytorch"},{"title":"sooheon/perceiver-jax","url":"https://github.com/sooheon/perceiver-jax"},{"title":"clementpoiret/Perceiver_MNIST","url":"https://github.com/clementpoiret/Perceiver_MNIST"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-1/perceiver"},{"title":"kietngt00/hmdb51-recognition","url":"https://github.com/kietngt00/hmdb51-recognition"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122961,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"PSLA (Single)","metrics":{"AUC":"0.975","Test mAP":"0.443","d-prime":"2.778"},"paper_url":"https://arxiv.org/abs/2102.01243v3","paper_title":"PSLA: Improving Audio Tagging with Pretraining, Sampling, Labeling, and Aggregation","paper_date":"2021-02-02","code_links":[{"title":"YuanGongND/psla","url":"https://github.com/YuanGongND/psla"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122962,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"PANNs-CNN14 (Single)","metrics":{"AUC":"0.973","Test mAP":"0.431","d-prime":"2.732"},"paper_url":"http://arxiv.org/abs/1912.10211v5","paper_title":"PANNs: Large-Scale Pretrained Audio Neural Networks for Audio Pattern Recognition","paper_date":"2020-08-23","code_links":[{"title":"PaddlePaddle/PaddleSpeech","url":"https://github.com/PaddlePaddle/PaddleSpeech"},{"title":"qiuqiangkong/audioset_tagging_cnn","url":"https://github.com/qiuqiangkong/audioset_tagging_cnn"},{"title":"google-research/leaf-audio","url":"https://github.com/google-research/leaf-audio"},{"title":"gudgud96/frechet-audio-distance","url":"https://github.com/gudgud96/frechet-audio-distance"},{"title":"yinkalario/General-Purpose-Sound-Recognition-Demo","url":"https://github.com/yinkalario/General-Purpose-Sound-Recognition-Demo"},{"title":"YuanGongND/psla","url":"https://github.com/YuanGongND/psla"},{"title":"nttcslab/composing-general-audio-repr","url":"https://github.com/nttcslab/composing-general-audio-repr"},{"title":"sithu31296/audio-tagging","url":"https://github.com/sithu31296/audio-tagging"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122963,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"EAT-M","metrics":{"Test mAP":"0.426"},"paper_url":"https://arxiv.org/abs/2204.11479v5","paper_title":"End-to-End Audio Strikes Back: Boosting Augmentations Towards An Efficient Audio Classification Network","paper_date":"2022-04-25","code_links":[{"title":"Alibaba-MIIL/AudioClassfication","url":"https://github.com/Alibaba-MIIL/AudioClassfication"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122964,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"Conformer (AS-2M)","metrics":{"Test mAP":"0.411"},"paper_url":"https://arxiv.org/abs/2110.07313v3","paper_title":"Conformer-Based Self-Supervised Learning for Non-Speech Audio Tasks","paper_date":"2021-10-14","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122965,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"EAT-S","metrics":{"Test mAP":"0.405"},"paper_url":"https://arxiv.org/abs/2204.11479v5","paper_title":"End-to-End Audio Strikes Back: Boosting Augmentations Towards An Efficient Audio Classification Network","paper_date":"2022-04-25","code_links":[{"title":"Alibaba-MIIL/AudioClassfication","url":"https://github.com/Alibaba-MIIL/AudioClassfication"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122966,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"WEANet-SUSTAIN","metrics":{"AUC":"0.972","Test mAP":"0.398"},"paper_url":"https://arxiv.org/abs/2007.00144v1","paper_title":"A Sequential Self Teaching Approach for Improving Generalization in Sound Event Recognition","paper_date":"2020-06-30","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122967,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"VATT-Base","metrics":{"AUC":"0.971","Test mAP":"0.394","d-prime":"2.895"},"paper_url":"https://arxiv.org/abs/2104.11178v3","paper_title":"VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text","paper_date":"2021-04-22","code_links":[{"title":"google-research/google-research","url":"https://github.com/google-research/google-research/tree/master/vatt"},{"title":"akashe/ProgrammingInterview","url":"https://github.com/akashe/ProgrammingInterview"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/3/vat"},{"title":"MindCode-4/code-9","url":"https://github.com/MindCode-4/code-9/tree/main/vat"},{"title":"MindCode-4/code-13","url":"https://github.com/MindCode-4/code-13/tree/main/vat"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122968,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"Multi-Format Contrastive","metrics":{"Test mAP":"0.376"},"paper_url":"https://arxiv.org/abs/2103.06508v3","paper_title":"Multi-Format Contrastive Learning of Audio Representations","paper_date":"2021-03-11","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122969,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"MMV","metrics":{"Test mAP":"0.309"},"paper_url":"https://arxiv.org/abs/2006.16228v2","paper_title":"Self-Supervised MultiModal Versatile Networks","paper_date":"2020-06-29","code_links":[{"title":"deepmind/deepmind-research","url":"https://github.com/deepmind/deepmind-research/tree/master/mmv"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122970,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"CAV-MAE (Visual-Only)","metrics":{"Test mAP":"0.262"},"paper_url":"https://arxiv.org/abs/2210.07839v4","paper_title":"Contrastive Audio-Visual Masked Autoencoder","paper_date":"2022-10-02","code_links":[{"title":"yuangongnd/cav-mae","url":"https://github.com/yuangongnd/cav-mae"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":1,"source":"archive","tags":[]},{"id":122971,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"L3","metrics":{"Test mAP":"0.249"},"paper_url":"http://arxiv.org/abs/1705.08168v2","paper_title":"Look, Listen and Learn","paper_date":"2017-05-23","code_links":[{"title":"marl/l3embedding","url":"https://github.com/marl/l3embedding"}],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":122972,"task":"Audio Classification","parent_task":"Classification","dataset":"AudioSet","model_name":"Triplet","metrics":{"Test mAP":"0.244"},"paper_url":"http://arxiv.org/abs/1711.02209v1","paper_title":"Unsupervised Learning of Semantic Audio Representations","paper_date":"2017-11-06","code_links":[],"metrics_order":"[\"Test mAP\", \"AUC\", \"d-prime\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]}]}