paper-with-me

Papers

Audiovisual SlowFast Networks for Video Recognition

2020-01-23 · Fanyi Xiao, Yong Jae Lee, Kristen Grauman, Jitendra Malik, Christoph Feichtenhofer

We present Audiovisual SlowFast Networks, an architecture for integrated audiovisual perception. AVSlowFast has Slow and Fast visual pathways that are deeply integrated with a Faster Audio pathway to model vision and sound in a unified representation. We fuse audio and visual features at multiple layers, enabling audio to contribute to the formation of hierarchical audiovisual concepts. To overcome training difficulties that arise from different learning dynamics for audio and visual modalities, we introduce DropPathway, which randomly drops the Audio pathway during training as an effective regularization technique. Inspired by prior studies in neuroscience, we perform hierarchical audiovisual synchronization to learn joint audiovisual features. We report state-of-the-art results on six video action classification and detection datasets, perform detailed ablation studies, and show the generalization of AVSlowFast to learn self-supervised audiovisual features. Code will be made available at: https://github.com/facebookresearch/SlowFast.

📄 PDF Abstract BibTeX arXiv:2001.08740

Code (3)

facebookresearch/SlowFast 공식 구현 pytorch
2023-MindSpore-4/Code11/tree/main/slowfast mindspore
code-implementation1/Code8/tree/main/slowfast mindspore

Tasks

Action ClassificationVideo Recognition

Methods 이 논문이 사용한 방법론

AVSlowFast Audiovisual SlowFast Network, or AVSlowFast, is an architecture for integrated audiovisual perception. AVSlowFast has Slow and Fast visual pathways that are integrated…
DropPathway DropPathway randomly drops an audio pathway during training as a regularization technique for audiovisual recognition models. Specifically, at each training iteration, we…

Similar Papers 제목 키워드 기반

SlowFast Networks for Video Recognition

2018-12-10 · ICCV 2019 10 · Christoph Feichtenhofer, Haoqi Fan, Jitendra Malik, Kaiming He

We present SlowFast networks for video recognition. Our model involves (i) a Slow pathway, operating at low frame rate, to capture spatial semantics, and (ii) a Fast pathway, operating at high frame rate, to capture moti…

Action ClassificationAction DetectionAction RecognitionAction Recognition In Videos+2

Challenge report:VIPriors Action Recognition Challenge

2020-07-16 · Zhipeng Luo, Dawei Xu, Zhiguang Zhang

This paper is a brief report to our submission to the VIPriors Action Recognition Challenge. Action recognition has attracted many researchers attention for its full application, but it is still challenging. In this pape…

Action Recognition

Robust Audiovisual Speech Recognition Models with Mixture-of-Experts

2024-09-19 · Yihan Wu, Yifan Peng, Yichen Lu, Xuankai Chang 외

Visual signals can enhance audiovisual speech recognition accuracy by providing additional contextual information. Given the complexity of visual signals, an audiovisual speech recognition model requires robust generaliz…

Mixture-of-ExpertsRobust Speech Recognitionspeech-recognitionSpeech Recognition

Audiovisual Moments in Time: A Large-Scale Annotated Dataset of Audiovisual Actions

2023-08-18 · PLOS ONE 2024 4 · Michael Joannou, Pia Rotshtein, Uta Noppeney

We present Audiovisual Moments in Time (AVMIT), a large-scale dataset of audiovisual action events. In an extensive annotation task 11 participants labelled a subset of 3-second audiovisual videos from the Moments in Tim…

APES: Audiovisual Person Search in Untrimmed Video

2021-06-03 · Juan Leon Alcazar, Long Mai, Federico Perazzi, Joon-Young Lee 외

Humans are arguably one of the most important subjects in video streams, many real-world applications such as video summarization or video editing workflows often require the automatic search and retrieval of a person of…

Person RetrievalPerson SearchRetrievalVideo Editing+1