{"task":"Vocal technique classification","dataset":"VocalSet","metric_names":["Accuracy "],"rows":[{"id":41153,"task":"Vocal technique classification","parent_task":"Music Classification","dataset":"VocalSet","model_name":"M2D2 AS+","metrics":{"Accuracy ":"78.9"},"paper_url":"https://arxiv.org/abs/2503.22104v1","paper_title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","paper_date":"2025-03-28","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Accuracy \"]","area":"Music","uses_additional_data":1,"source":"archive","tags":[]},{"id":41154,"task":"Vocal technique classification","parent_task":"Music Classification","dataset":"VocalSet","model_name":"M2D2","metrics":{"Accuracy ":"77.4"},"paper_url":"https://arxiv.org/abs/2503.22104v1","paper_title":"M2D2: Exploring General-purpose Audio-Language Representations Beyond CLAP","paper_date":"2025-03-28","code_links":[{"title":"nttcslab/m2d","url":"https://github.com/nttcslab/m2d"},{"title":"nttcslab/eval-audio-repr","url":"https://github.com/nttcslab/eval-audio-repr"}],"metrics_order":"[\"Accuracy \"]","area":"Music","uses_additional_data":1,"source":"archive","tags":[]}]}