{"task":"Instrument Recognition","dataset":"NSynth","metric_names":["Accuracy"],"rows":[{"id":133191,"task":"Instrument Recognition","parent_task":null,"dataset":"NSynth","model_name":"M2D-CLAP","metrics":{"Accuracy":"80.6"},"paper_url":"https://arxiv.org/abs/2503.22104v1","paper_title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","paper_date":"2025-03-28","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Accuracy\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":133192,"task":"Instrument Recognition","parent_task":null,"dataset":"NSynth","model_name":"M2D2 AS+","metrics":{"Accuracy":"79.7"},"paper_url":"https://arxiv.org/abs/2503.22104v1","paper_title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","paper_date":"2025-03-28","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Accuracy\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":133193,"task":"Instrument Recognition","parent_task":null,"dataset":"NSynth","model_name":"M2D AS","metrics":{"Accuracy":"78.7"},"paper_url":"https://arxiv.org/abs/2503.22104v1","paper_title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","paper_date":"2025-03-28","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Accuracy\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":133194,"task":"Instrument Recognition","parent_task":null,"dataset":"NSynth","model_name":"MATPAC (SSL, linear eval)","metrics":{"Accuracy":"74.6"},"paper_url":"https://arxiv.org/abs/2502.12031v1","paper_title":"Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning","paper_date":"2025-02-17","code_links":[{"title":"aurianworld/matpac","url":"https://github.com/aurianworld/matpac"}],"metrics_order":"[\"Accuracy\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":133195,"task":"Instrument Recognition","parent_task":null,"dataset":"NSynth","model_name":"melspect","metrics":{"Accuracy":"72.1"},"paper_url":"https://arxiv.org/abs/2207.05508v1","paper_title":"EfficientLEAF: A Faster LEarnable Audio Frontend of Questionable Use","paper_date":"2022-07-12","code_links":[{"title":"cpjku/efficientleaf","url":"https://github.com/cpjku/efficientleaf"}],"metrics_order":"[\"Accuracy\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":133196,"task":"Instrument Recognition","parent_task":null,"dataset":"NSynth","model_name":"EfficientLEAF","metrics":{"Accuracy":"71.7"},"paper_url":"https://arxiv.org/abs/2207.05508v1","paper_title":"EfficientLEAF: A Faster LEarnable Audio Frontend of Questionable Use","paper_date":"2022-07-12","code_links":[{"title":"cpjku/efficientleaf","url":"https://github.com/cpjku/efficientleaf"}],"metrics_order":"[\"Accuracy\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]},{"id":133197,"task":"Instrument Recognition","parent_task":null,"dataset":"NSynth","model_name":"LEAF","metrics":{"Accuracy":"69.2"},"paper_url":"https://arxiv.org/abs/2207.05508v1","paper_title":"EfficientLEAF: A Faster LEarnable Audio Frontend of Questionable Use","paper_date":"2022-07-12","code_links":[{"title":"cpjku/efficientleaf","url":"https://github.com/cpjku/efficientleaf"}],"metrics_order":"[\"Accuracy\"]","area":"Audio","uses_additional_data":0,"source":"archive","tags":[]}]}