paper-with-me

Papers

ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds

2024-07-10 · Yashwardhan Chaudhuri, Paridhi Mundra, Arnesh Batra, Orchid Chetia Phukan, Arun Balaji Buduru

Recognition and interpretation of bird vocalizations are pivotal in ornithological research and ecological conservation efforts due to their significance in understanding avian behaviour, performing habitat assessment and judging ecological health. This paper presents an audio spectrogram-guided classification framework called ASGIR for improved bird sound recognition and information retrieval. Our work is accompanied by a simple-to-use, two-step information retrieval system that uses geographical location and bird sounds to localize and retrieve relevant bird information by scraping Wikipedia page information of recognized birds. ASGIR offers a substantial performance on a random subset of 51 classes of Xeno-Canto dataset Bird sounds from European countries with a median of 100\% performance on F1, Precision and Sensitivity metrics. Our code is available as follows: https://github.com/MainSample1234/AS-GIR .

📄 PDF Abstract BibTeX arXiv:2407.18927

Code (1)

mainsample1234/as-gir 공식 구현 pytorch

Tasks

Information RetrievalRetrieval

Similar Papers 제목 키워드 기반

AST: Audio Spectrogram Transformer

2021-04-05 · Yuan Gong, Yu-An Chung, James Glass

In the past decade, convolutional neural networks (CNNs) have been widely adopted as the main building block for end-to-end audio classification models, which aim to learn a direct mapping from audio spectrograms to corr…

Audio ClassificationAudio TaggingClassificationGeneral Classification+3

Transformer-based Sequence Labeling for Audio Classification based on MFCCs

2023-04-30 · C. S. Sonali, Chinmayi B S, Ahana Balasubramanian

Audio classification is vital in areas such as speech and music recognition. Feature extraction from the audio signal, such as Mel-Spectrograms and MFCCs, is a critical step in audio classification. These features are tr…

Audio ClassificationClassification

From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers

2024-01-16 · Jiu Feng, Mehmet Hamza Erol, Joon Son Chung, Arda Senocak

Transformers have become central to recent advances in audio classification. However, training an audio spectrogram transformer, e.g. AST, from scratch can be resource and time-intensive. Furthermore, the complexity of t…

Audio Classification

FastAST: Accelerating Audio Spectrogram Transformer via Token Merging and Cross-Model Knowledge Distillation

2024-06-11 · Swarup Ranjan Behera, Abhishek Dhiman, Karthik Gowda, Aalekhya Satya Narayani

Audio classification models, particularly the Audio Spectrogram Transformer (AST), play a crucial role in efficient audio analysis. However, optimizing their efficiency without compromising accuracy remains a challenge. …

Audio ClassificationKnowledge Distillation

SSAST: Self-Supervised Audio Spectrogram Transformer

2021-10-19 · Yuan Gong, Cheng-I Jeff Lai, Yu-An Chung, James Glass

Recently, neural networks based purely on self-attention, such as the Vision Transformer (ViT), have been shown to outperform deep learning models constructed with convolutional neural networks (CNNs) on various vision t…

Audio ClassificationClassificationEmotion RecognitionKeyword Spotting+3