Audio Classification
22개 벤치마크 · 논문 413편 · 이 태스크의 논문 보기 →
Benchmarks
AudioSet
ESC-50
VGGSound
SHD
FSD50K
Balanced Audio Set
Speech Commands
DCASE
SSC
BirdCLEF 2021
EPIC-KITCHENS-100
Audio Set
CREMA-D
DiCOVA
EPIC-SOUNDS
RAVDESS
VocalSound
Multimodal PISA
Most implemented
CNN Architectures for Large-Scale Audio Classification
Perceiver: General Perception with Iterative Attention
LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment
VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text
AST: Audio Spectrogram Transformer
Multi-level Attention Model for Weakly Supervised Audio Classification
Papers
Few-Shot Open-Set Audio Classification via Transductive Prototype Refinement and Class Logit Enhancement
Few-shot Open-set audio classification requires classifying query samples from known classes with a few labeled support samples while rejecting query samples from unknown classes. Transductive inference jointly observes …
Audio ClassificationEdgeFaaS: A Function-based Framework for Edge Computing
Edge computing brings unique challenges as the resources on the edge are highly diverse in capabilities and capacities, and highly distributed across many users and the physical world. Existing distributed computing fram…
Audio ClassificationFederated LearningTriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios
There are some datasets of varying scales for audio classification (AC) applied to different tasks. However, annotated data is limited for most scenarios, such as domestic environments. To address this challenge, we prop…
Audio ClassificationA Multi-Branch Hierarchy-Aware Framework for Heterogeneous Audio Classification
This technical report describes our system for Task 1 of the DCASE 2026 Challenge, which aims to classify heterogeneous audio recordings according to the Broad Sound Taxonomy (BST). The task requires both accurate second…
Audio ClassificationFew-Shot Open-Set Audio Classification Using Attention Information-Fused Prototypes
Most existing audio classification methods suppose that each query (testing) sample belongs to a class of support (training) samples, and misrecognize samples of unseen classes as seen classes (cannot reject samples of u…
Audio ClassificationZEBRA: Zero-Shot Entropy-Regularized Prompt Learning for Base-to-Novel Generalization in Audio-Language Models
Audio-Language Models (ALMs) achieve strong zero-shot performance by aligning audio with textual class descriptions. Although prompt learning improves accuracy on base classes through few-shot supervised adaptation, we o…
Audio Classification