paper-with-me

홈 › Papers

VGGSound: A Large-scale Audio-Visual Dataset

2020-04-29 · Honglie Chen, Weidi Xie, Andrea Vedaldi, Andrew Zisserman

Our goal is to collect a large-scale audio-visual dataset with low label noise from videos in the wild using computer vision techniques. The resulting dataset can be used for training and evaluating audio recognition models. We make three contributions. First, we propose a scalable pipeline based on computer vision techniques to create an audio dataset from open-source media. Our pipeline involves obtaining videos from YouTube; using image classification algorithms to localize audio-visual correspondence; and filtering out ambient noise using audio verification. Second, we use this pipeline to curate the VGGSound dataset consisting of more than 210k videos for 310 audio classes. Third, we investigate various Convolutional Neural Network~(CNN) architectures and aggregation approaches to establish audio recognition baselines for our new dataset. Compared to existing audio datasets, VGGSound ensures audio-visual correspondence and is collected under unconstrained conditions. Code and the dataset are available at http://www.robots.ox.ac.uk/~vgg/data/vggsound/

📄 PDF Abstract BibTeX arXiv:2004.14368

Code (3)

SarthakYadav/GISE-51-pytorch pytorch
jasongief/cpsp pytorch
yangyucheng000/papercode-2/tree/main/vglaw-mindspore mindspore

Tasks

image-classificationImage Classification

Similar Papers 제목 키워드 기반

VGGSounder: Audio-Visual Evaluations for Foundation Models

2025-08-11 · Daniil Zverev, Thaddäus Wiedemer, Ameya Prabhu, Matthias Bethge 외 arxiv

The emergence of audio-visual foundation models underscores the importance of reliably assessing their multi-modal understanding. The VGGSound dataset is commonly used as a benchmark for evaluation audio-visual classific…

Quality Over Quantity? LLM-Based Curation for a Data-Efficient Audio-Video Foundation Model

2025-03-12 · Ali Vosoughi, Dimitra Emmanouilidou, Hannes Gamper

Integrating audio and visual data for training multimodal foundational models remains challenging. We present Audio-Video Vector Alignment (AVVA), which aligns audiovisual (AV) scene content beyond mere temporal synchron…

AudioCapsContrastive LearningLarge Language ModelRetrieval+1

Siamese Vision Transformers are Scalable Audio-visual Learners

2024-03-28 · Yan-Bo Lin, Gedas Bertasius

Traditional audio-visual methods rely on independent audio and visual backbones, which is costly and not scalable. In this work, we investigate using an audio-visual siamese network (AVSiam) for efficient and scalable au…

Contrastive LearningGPURetrieval

$\texttt{AVROBUSTBENCH}$: Benchmarking the Robustness of Audio-Visual Recognition Models at Test-Time

2025-05-31 · Sarthak Kumar Maharana, Saksham Singh Kushwaha, Baoming Zhang, Adrian Rodriguez 외

While recent audio-visual models have demonstrated impressive performance, their robustness to distributional shifts at test-time remains not fully understood. Existing robustness benchmarks mainly focus on single modali…

BenchmarkingTest-time Adaptation

Audio-Visual Class-Incremental Learning

2023-08-21 · ICCV 2023 1 · Weiguo Pian, Shentong Mo, Yunhui Guo, Yapeng Tian

In this paper, we introduce audio-visual class-incremental learning, a class-incremental learning scenario for audio-visual video recognition. We demonstrate that joint audio-visual modeling can improve class-incremental…

class-incremental learningClass Incremental LearningIncremental LearningSemantic Similarity+2