{"task":"Action Recognition","dataset":"Something-Something V2","metric_names":["Top-1 Accuracy","Top-5 Accuracy","Parameters","GFLOPs"],"rows":[{"id":590093,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"Decoupled Object-Centric Video Understan","metrics":{"Top-1 Accuracy":"86.79"},"paper_url":"https://paperswithcode.com/paper/decoupled-object-centric-video-understanding-for-generating-robotic-manipulation-commands","paper_title":"Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands","paper_date":"2026-06-15","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":29964,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MVD (Kinetics400 pretrain, ViT-H, 16 frame)","metrics":{"GFLOPs":"1192x6","Parameters":"633","Top-1 Accuracy":"77.3","Top-5 Accuracy":"95.7"},"paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","paper_date":"2022-12-08","code_links":[{"title":"ruiwang2021/mvd","url":"https://github.com/ruiwang2021/mvd"},{"title":"2023-MindSpore-4/Code-5","url":"https://github.com/2023-MindSpore-4/Code-5/tree/main/MVD"},{"title":"Mind23-2/MindCode-3","url":"https://github.com/Mind23-2/MindCode-3/tree/main/MVD"},{"title":"Mind23-2/MindCode-101","url":"https://github.com/Mind23-2/MindCode-101/tree/main/MVD"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29965,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"DejaVid","metrics":{"Top-1 Accuracy":"77.2","Top-5 Accuracy":"96.3"},"paper_url":"http://openaccess.thecvf.com//content/CVPR2025/html/Ho_DejaVid_Encoder-Agnostic_Learned_Temporal_Matching_for_Video_Classification_CVPR_2025_paper.html","paper_title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","paper_date":"2025-01-01","code_links":[{"title":"darrylho/dejavid","url":"https://github.com/darrylho/dejavid"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29966,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"InternVideo","metrics":{"Top-1 Accuracy":"77.2"},"paper_url":"https://arxiv.org/abs/2212.03191v2","paper_title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","paper_date":"2022-12-06","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"yingsen1/unimd","url":"https://github.com/yingsen1/unimd"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29967,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"InternVideo2-1B","metrics":{"Top-1 Accuracy":"77.1"},"paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_date":"2024-03-22","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29968,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"VideoMAE V2-g","metrics":{"GFLOPs":"2544x6","Parameters":"1013","Top-1 Accuracy":"77.0","Top-5 Accuracy":"95.9"},"paper_url":"https://arxiv.org/abs/2303.16727v2","paper_title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","paper_date":"2023-03-29","code_links":[{"title":"OpenGVLab/VideoMAEv2","url":"https://github.com/OpenGVLab/VideoMAEv2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29969,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MVD (Kinetics400 pretrain, ViT-L, 16 frame)","metrics":{"GFLOPs":"597x6","Parameters":"305","Top-1 Accuracy":"76.7","Top-5 Accuracy":"95.5"},"paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","paper_date":"2022-12-08","code_links":[{"title":"ruiwang2021/mvd","url":"https://github.com/ruiwang2021/mvd"},{"title":"2023-MindSpore-4/Code-5","url":"https://github.com/2023-MindSpore-4/Code-5/tree/main/MVD"},{"title":"Mind23-2/MindCode-3","url":"https://github.com/Mind23-2/MindCode-3/tree/main/MVD"},{"title":"Mind23-2/MindCode-101","url":"https://github.com/Mind23-2/MindCode-101/tree/main/MVD"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29970,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"Hiera-L (no extra data)","metrics":{"Top-1 Accuracy":"76.5"},"paper_url":"https://arxiv.org/abs/2306.00989v1","paper_title":"Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles","paper_date":"2023-06-01","code_links":[{"title":"huggingface/pytorch-image-models","url":"https://github.com/huggingface/pytorch-image-models"},{"title":"facebookresearch/hiera","url":"https://github.com/facebookresearch/hiera"},{"title":"leondgarse/keras_cv_attention_models","url":"https://github.com/leondgarse/keras_cv_attention_models/tree/main/keras_cv_attention_models/hiera"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29971,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TubeViT-L","metrics":{"Top-1 Accuracy":"76.1","Top-5 Accuracy":"95.2"},"paper_url":"https://arxiv.org/abs/2212.03229v1","paper_title":"Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video Learning","paper_date":"2022-12-06","code_links":[{"title":"daniel-code/TubeViT","url":"https://github.com/daniel-code/TubeViT"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29972,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"VideoMAE (no extra data, ViT-L, 32x2)","metrics":{"GFLOPs":"1436x3","Parameters":"305","Top-1 Accuracy":"75.4","Top-5 Accuracy":"95.2"},"paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","paper_date":"2022-03-23","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"MCG-NJU/VideoMAE","url":"https://github.com/MCG-NJU/VideoMAE"},{"title":"MCG-NJU/VideoMAE-Action-Detection","url":"https://github.com/MCG-NJU/VideoMAE-Action-Detection"},{"title":"innat/VideoMAE","url":"https://github.com/innat/VideoMAE"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/5/videomae"},{"title":"MS-P3/code7","url":"https://github.com/MS-P3/code7/tree/main/videomae"},{"title":"MindSpore-scientific/code-7","url":"https://github.com/MindSpore-scientific/code-7/tree/main/VideoMAE"},{"title":"MindCode-4/code-1","url":"https://github.com/MindCode-4/code-1/tree/main/videomae"},{"title":"MindSpore-scientific/code-13","url":"https://github.com/MindSpore-scientific/code-13/tree/main/token_learner"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29973,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"Side4Video (EVA ViT-E/14)","metrics":{"Top-1 Accuracy":"75.2","Top-5 Accuracy":"94.0"},"paper_url":"https://arxiv.org/abs/2311.15769v1","paper_title":"Side4Video: Spatial-Temporal Side Network for Memory-Efficient Image-to-Video Transfer Learning","paper_date":"2023-11-27","code_links":[{"title":"whwu95/ATM","url":"https://github.com/whwu95/ATM"},{"title":"HJYao00/Side4Video","url":"https://github.com/HJYao00/Side4Video"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29974,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MaskFeat (Kinetics600 pretrain, MViT-L)","metrics":{"GFLOPs":"2828*3","Parameters":"218","Top-1 Accuracy":"75.0","Top-5 Accuracy":"95.0"},"paper_url":"https://arxiv.org/abs/2112.09133v2","paper_title":"Masked Feature Prediction for Self-Supervised Visual Pre-Training","paper_date":"2021-12-16","code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"open-mmlab/mmselfsup","url":"https://github.com/open-mmlab/mmselfsup"},{"title":"Westlake-AI/openmixup","url":"https://github.com/Westlake-AI/openmixup"},{"title":"mx-mark/videotransformer-pytorch","url":"https://github.com/mx-mark/videotransformer-pytorch"},{"title":"mx-mark/dmjd","url":"https://github.com/mx-mark/dmjd"},{"title":"yyk-wew/semanticmim","url":"https://github.com/yyk-wew/semanticmim"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29975,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MAR (50% mask, ViT-L, 16x4)","metrics":{"GFLOPs":"276x6","Parameters":"311","Top-1 Accuracy":"74.7","Top-5 Accuracy":"94.9"},"paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","paper_date":"2022-07-24","code_links":[{"title":"alibaba-mmai-research/masked-action-recognition","url":"https://github.com/alibaba-mmai-research/masked-action-recognition"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29976,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"ATM","metrics":{"Top-1 Accuracy":"74.6","Top-5 Accuracy":"94.4"},"paper_url":"https://arxiv.org/abs/2307.08908v2","paper_title":"What Can Simple Arithmetic Operations Do for Temporal Modeling?","paper_date":"2023-07-18","code_links":[{"title":"whwu95/ATM","url":"https://github.com/whwu95/ATM"},{"title":"HJYao00/Side4Video","url":"https://github.com/HJYao00/Side4Video"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29977,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MAWS (ViT-L)","metrics":{"Top-1 Accuracy":"74.4"},"paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","paper_date":"2023-03-23","code_links":[{"title":"facebookresearch/maws","url":"https://github.com/facebookresearch/maws"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29978,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"VideoMAE (no extra data, ViT-L, 16frame)","metrics":{"GFLOPs":"597x6","Parameters":"305","Top-1 Accuracy":"74.3","Top-5 Accuracy":"94.6"},"paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","paper_date":"2022-03-23","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"MCG-NJU/VideoMAE","url":"https://github.com/MCG-NJU/VideoMAE"},{"title":"MCG-NJU/VideoMAE-Action-Detection","url":"https://github.com/MCG-NJU/VideoMAE-Action-Detection"},{"title":"innat/VideoMAE","url":"https://github.com/innat/VideoMAE"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/5/videomae"},{"title":"MS-P3/code7","url":"https://github.com/MS-P3/code7/tree/main/videomae"},{"title":"MindSpore-scientific/code-7","url":"https://github.com/MindSpore-scientific/code-7/tree/main/VideoMAE"},{"title":"MindCode-4/code-1","url":"https://github.com/MindCode-4/code-1/tree/main/videomae"},{"title":"MindSpore-scientific/code-13","url":"https://github.com/MindSpore-scientific/code-13/tree/main/token_learner"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29979,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MAR (75% mask, ViT-L, 16x4)","metrics":{"GFLOPs":"131x6","Parameters":"311","Top-1 Accuracy":"73.8","Top-5 Accuracy":"94.4"},"paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","paper_date":"2022-07-24","code_links":[{"title":"alibaba-mmai-research/masked-action-recognition","url":"https://github.com/alibaba-mmai-research/masked-action-recognition"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29980,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MVD (Kinetics400 pretrain, ViT-B, 16 frame)","metrics":{"GFLOPs":"180x6","Parameters":"87","Top-1 Accuracy":"73.7","Top-5 Accuracy":"94.0"},"paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","paper_date":"2022-12-08","code_links":[{"title":"ruiwang2021/mvd","url":"https://github.com/ruiwang2021/mvd"},{"title":"2023-MindSpore-4/Code-5","url":"https://github.com/2023-MindSpore-4/Code-5/tree/main/MVD"},{"title":"Mind23-2/MindCode-3","url":"https://github.com/Mind23-2/MindCode-3/tree/main/MVD"},{"title":"Mind23-2/MindCode-101","url":"https://github.com/Mind23-2/MindCode-101/tree/main/MVD"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29981,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"ViC-MAE (ViT-L)","metrics":{"Top-1 Accuracy":"73.7"},"paper_url":"https://arxiv.org/abs/2303.12001v3","paper_title":"ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders","paper_date":"2023-03-21","code_links":[{"title":"jeffhernandez1995/vic-mae","url":"https://github.com/jeffhernandez1995/vic-mae"},{"title":"MindCode-4/code-5","url":"https://github.com/MindCode-4/code-5/tree/main/vit_mae"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29982,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TAdaFormer-L/14","metrics":{"Top-1 Accuracy":"73.6"},"paper_url":"https://arxiv.org/abs/2308.05787v1","paper_title":"Temporally-Adaptive Models for Efficient Video Understanding","paper_date":"2023-08-10","code_links":[{"title":"alibaba-mmai-research/TAdaConv","url":"https://github.com/alibaba-mmai-research/TAdaConv"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29983,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TDS-CLIP-ViT-L/14(8frames)","metrics":{"Top-1 Accuracy":"73.4","Top-5 Accuracy":"93.8"},"paper_url":"https://arxiv.org/abs/2408.10688v1","paper_title":"TDS-CLIP: Temporal Difference Side Network for Image-to-Video Transfer Learning","paper_date":"2024-08-20","code_links":[{"title":"BBYL9413/TDS-CLIP","url":"https://github.com/BBYL9413/TDS-CLIP"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29984,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MViTv2-L (IN-21K + Kinetics400 pretrain)","metrics":{"Parameters":"213.1","Top-1 Accuracy":"73.3","Top-5 Accuracy":"94.1"},"paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","paper_date":"2021-12-02","code_links":[{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"facebookresearch/detectron2","url":"https://github.com/facebookresearch/detectron2/tree/main/projects/MViTv2"},{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"open-mmlab/mmclassification","url":"https://github.com/open-mmlab/mmclassification"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"JunweiLiang/aicity_action","url":"https://github.com/JunweiLiang/aicity_action"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"},{"title":"rajatmodi62/occludedactionbenchmark","url":"https://github.com/rajatmodi62/occludedactionbenchmark"},{"title":"3dperceptionlab/visual-wetlandbirds","url":"https://github.com/3dperceptionlab/visual-wetlandbirds"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29985,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"AMD(ViT-B/16)","metrics":{"GFLOPs":"180x6","Parameters":"87","Top-1 Accuracy":"73.3","Top-5 Accuracy":"94.0"},"paper_url":"https://arxiv.org/abs/2311.03149v2","paper_title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","paper_date":"2023-11-06","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29986,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"UniFormerV2-L","metrics":{"GFLOPs":"5154","Top-1 Accuracy":"73.0","Top-5 Accuracy":"94.5"},"paper_url":"https://openreview.net/forum?id=d77RVuVg-Mf","paper_title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","paper_date":"2022-09-22","code_links":[{"title":"OpenGVLab/UniFormerV2","url":"https://github.com/OpenGVLab/UniFormerV2"},{"title":"innat/UniFormerV2","url":"https://github.com/innat/UniFormerV2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29987,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"ST-Adapter (ViT-L, CLIP)","metrics":{"GFLOPs":"8248","Top-1 Accuracy":"72.3","Top-5 Accuracy":"93.9"},"paper_url":"https://arxiv.org/abs/2206.13559v3","paper_title":"ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning","paper_date":"2022-06-27","code_links":[{"title":"linziyi96/st-adapter","url":"https://github.com/linziyi96/st-adapter"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29988,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"ZeroI2V ViT-L/14","metrics":{"Top-1 Accuracy":"72.2","Top-5 Accuracy":"93.0"},"paper_url":"https://arxiv.org/abs/2310.01324v2","paper_title":"ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video","paper_date":"2023-10-02","code_links":[{"title":"mcg-nju/zeroi2v","url":"https://github.com/mcg-nju/zeroi2v"},{"title":"leexinhao/ZeroI2V","url":"https://github.com/leexinhao/ZeroI2V"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29989,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MViT-B (IN-21K + Kinetics400 pretrain)","metrics":{"GFLOPs":"225x3","Top-1 Accuracy":"72.1"},"paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","paper_date":"2021-12-02","code_links":[{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"facebookresearch/detectron2","url":"https://github.com/facebookresearch/detectron2/tree/main/projects/MViTv2"},{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"open-mmlab/mmclassification","url":"https://github.com/open-mmlab/mmclassification"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"JunweiLiang/aicity_action","url":"https://github.com/JunweiLiang/aicity_action"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"},{"title":"rajatmodi62/occludedactionbenchmark","url":"https://github.com/rajatmodi62/occludedactionbenchmark"},{"title":"3dperceptionlab/visual-wetlandbirds","url":"https://github.com/3dperceptionlab/visual-wetlandbirds"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29990,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"CAST(ViT-B/16)","metrics":{"Top-1 Accuracy":"71.6"},"paper_url":"https://arxiv.org/abs/2311.18825v2","paper_title":"CAST: Cross-Attention in Space and Time for Video Action Recognition","paper_date":"2023-11-30","code_links":[{"title":"khu-vll/cast","url":"https://github.com/khu-vll/cast"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29991,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"StructVit-B-4-1","metrics":{"Top-1 Accuracy":"71.5"},"paper_url":"https://arxiv.org/abs/2404.03924v1","paper_title":"Learning Correlation Structures for Vision Transformers","paper_date":"2024-04-05","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29992,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"OMNIVORE (Swin-B,  IN-21K+ Kinetics400 pretrain)","metrics":{"Top-1 Accuracy":"71.4","Top-5 Accuracy":"93.5"},"paper_url":"https://arxiv.org/abs/2201.08377v2","paper_title":"Omnivore: A Single Model for Many Visual Modalities","paper_date":"2022-01-20","code_links":[{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/omnivore","url":"https://github.com/facebookresearch/omnivore"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29993,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"BEVT (IN-1K + Kinetics400 pretrain)","metrics":{"GFLOPs":"321x3","Parameters":"89","Top-1 Accuracy":"71.4","Top-5 Accuracy":"-"},"paper_url":"https://arxiv.org/abs/2112.01529v3","paper_title":"BEVT: BERT Pretraining of Video Transformers","paper_date":"2021-12-02","code_links":[{"title":"xyzforever/bevt","url":"https://github.com/xyzforever/bevt"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29994,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"UniFormer-B (IN-1K + Kinetics400 pretrain)","metrics":{"GFLOPs":"259x3","Parameters":"50.1","Top-1 Accuracy":"71.2","Top-5 Accuracy":"92.8"},"paper_url":"https://openreview.net/forum?id=nBU_u6DLvoK","paper_title":"UniFormer: Unified Transformer for Efficient Spatial-Temporal Representation Learning","paper_date":"2021-09-29","code_links":[{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"sense-x/uniformer","url":"https://github.com/sense-x/uniformer"},{"title":"lucidrains/uniformer-pytorch","url":"https://github.com/lucidrains/uniformer-pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29995,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TAdaConvNeXtV2-B","metrics":{"Top-1 Accuracy":"71.1"},"paper_url":"https://arxiv.org/abs/2308.05787v1","paper_title":"Temporally-Adaptive Models for Efficient Video Understanding","paper_date":"2023-08-10","code_links":[{"title":"alibaba-mmai-research/TAdaConv","url":"https://github.com/alibaba-mmai-research/TAdaConv"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29996,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MAR (50% mask, ViT-B, 16x4)","metrics":{"GFLOPs":"86x6","Parameters":"94","Top-1 Accuracy":"71.0","Top-5 Accuracy":"92.8"},"paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","paper_date":"2022-07-24","code_links":[{"title":"alibaba-mmai-research/masked-action-recognition","url":"https://github.com/alibaba-mmai-research/masked-action-recognition"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":29997,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MVD (Kinetics400 pretrain, ViT-S, 16 frame)","metrics":{"GFLOPs":"57x6","Parameters":"22","Top-1 Accuracy":"70.9","Top-5 Accuracy":"92.8"},"paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","paper_date":"2022-12-08","code_links":[{"title":"ruiwang2021/mvd","url":"https://github.com/ruiwang2021/mvd"},{"title":"2023-MindSpore-4/Code-5","url":"https://github.com/2023-MindSpore-4/Code-5/tree/main/MVD"},{"title":"Mind23-2/MindCode-3","url":"https://github.com/Mind23-2/MindCode-3/tree/main/MVD"},{"title":"Mind23-2/MindCode-101","url":"https://github.com/Mind23-2/MindCode-101/tree/main/MVD"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29998,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"CoVeR(JFT-3B)","metrics":{"Top-1 Accuracy":"70.9","Top-5 Accuracy":"92.5"},"paper_url":"https://arxiv.org/abs/2112.07175v1","paper_title":"Co-training Transformer with Videos and Images Improves Action Recognition","paper_date":"2021-12-14","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":29999,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"VideoMAE (no extra data, ViT-B, 16frame)","metrics":{"GFLOPs":"180x6","Parameters":"87","Top-1 Accuracy":"70.8","Top-5 Accuracy":"92.4"},"paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","paper_date":"2022-03-23","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"MCG-NJU/VideoMAE","url":"https://github.com/MCG-NJU/VideoMAE"},{"title":"MCG-NJU/VideoMAE-Action-Detection","url":"https://github.com/MCG-NJU/VideoMAE-Action-Detection"},{"title":"innat/VideoMAE","url":"https://github.com/innat/VideoMAE"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/5/videomae"},{"title":"MS-P3/code7","url":"https://github.com/MS-P3/code7/tree/main/videomae"},{"title":"MindSpore-scientific/code-7","url":"https://github.com/MindSpore-scientific/code-7/tree/main/VideoMAE"},{"title":"MindCode-4/code-1","url":"https://github.com/MindCode-4/code-1/tree/main/videomae"},{"title":"MindSpore-scientific/code-13","url":"https://github.com/MindSpore-scientific/code-13/tree/main/token_learner"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30000,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"AMD(ViT-S/16)","metrics":{"GFLOPs":"57x6","Parameters":"22","Top-1 Accuracy":"70.2","Top-5 Accuracy":"92.5"},"paper_url":"https://arxiv.org/abs/2311.03149v2","paper_title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","paper_date":"2023-11-06","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30001,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"ILA (ViT-L/14)","metrics":{"Top-1 Accuracy":"70.2","Top-5 Accuracy":"91.8"},"paper_url":"https://arxiv.org/abs/2304.10465v2","paper_title":"Implicit Temporal Modeling with Learnable Alignment for Video Recognition","paper_date":"2023-04-20","code_links":[{"title":"francis-rings/ila","url":"https://github.com/francis-rings/ila"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30002,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MorphMLP-B (IN-1K)","metrics":{"GFLOPs":"197x3","Parameters":"68.5","Top-1 Accuracy":"70.1","Top-5 Accuracy":"92.8"},"paper_url":"https://arxiv.org/abs/2111.12527v3","paper_title":"MorphMLP: An Efficient MLP-Like Backbone for Spatial-Temporal Representation Learning","paper_date":"2021-11-24","code_links":[{"title":"liuruiyang98/Jittor-MLP","url":"https://github.com/liuruiyang98/Jittor-MLP"},{"title":"MTLab/MorphMLP","url":"https://github.com/MTLab/MorphMLP"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30003,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"CoVeR(JFT-300M)","metrics":{"Top-1 Accuracy":"69.8","Top-5 Accuracy":"91.9"},"paper_url":"https://arxiv.org/abs/2112.07175v1","paper_title":"Co-training Transformer with Videos and Images Improves Action Recognition","paper_date":"2021-12-14","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30004,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TPS","metrics":{"Top-1 Accuracy":"69.8"},"paper_url":"https://arxiv.org/abs/2207.13259v1","paper_title":"Spatiotemporal Self-attention Modeling with Temporal Patch Shift for Action Recognition","paper_date":"2022-07-27","code_links":[{"title":"martinxm/tps","url":"https://github.com/martinxm/tps"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30005,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"SIFA","metrics":{"Top-1 Accuracy":"69.8"},"paper_url":"https://arxiv.org/abs/2206.06931v1","paper_title":"Stand-Alone Inter-Frame Attention in Video Models","paper_date":"2022-06-14","code_links":[{"title":"fuchenustc/sifa","url":"https://github.com/fuchenustc/sifa"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30006,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"Swin-B (IN-21K + Kinetics400 pretrain)","metrics":{"GFLOPs":"321x3","Parameters":"89","Top-1 Accuracy":"69.6","Top-5 Accuracy":"92.7"},"paper_url":"https://arxiv.org/abs/2106.13230v1","paper_title":"Video Swin Transformer","paper_date":"2021-06-24","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/en/model_zoo/recognition/videoswin.md"},{"title":"SwinTransformer/Video-Swin-Transformer","url":"https://github.com/SwinTransformer/Video-Swin-Transformer"},{"title":"haofanwang/video-swin-transformer-pytorch","url":"https://github.com/haofanwang/video-swin-transformer-pytorch"},{"title":"wangjk666/stts","url":"https://github.com/wangjk666/stts"},{"title":"innat/VideoSwin","url":"https://github.com/innat/VideoSwin"},{"title":"MohammadRezaQaderi/Video-Swin-Transformer","url":"https://github.com/MohammadRezaQaderi/Video-Swin-Transformer"},{"title":"Whiffe/mmaction2_YF","url":"https://github.com/Whiffe/mmaction2_YF"},{"title":"3dperceptionlab/visual-wetlandbirds","url":"https://github.com/3dperceptionlab/visual-wetlandbirds"},{"title":"ytw1996/swin3d_mindspore","url":"https://github.com/ytw1996/swin3d_mindspore"},{"title":"w-sugar/Video-Swin-Transformer","url":"https://github.com/w-sugar/Video-Swin-Transformer"},{"title":"visaVita/mmaction2","url":"https://github.com/visaVita/mmaction2"},{"title":"acewjh/Video-Swin-Transformer","url":"https://github.com/acewjh/Video-Swin-Transformer"},{"title":"EquipoVandV/mmactionVandV","url":"https://github.com/EquipoVandV/mmactionVandV"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30007,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TDN ResNet101 (one clip, three crop, 8+16 ensemble, ImageNet pretrained, RGB only)","metrics":{"GFLOPs":"198x3","Top-1 Accuracy":"69.6","Top-5 Accuracy":"92.2"},"paper_url":"https://arxiv.org/abs/2012.10071v2","paper_title":"TDN: Temporal Difference Networks for Efficient Action Recognition","paper_date":"2020-12-18","code_links":[{"title":"MCG-NJU/TDN","url":"https://github.com/MCG-NJU/TDN"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30008,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MAR (75% mask, ViT-B, 16x4)","metrics":{"GFLOPs":"41x6","Parameters":"94","Top-1 Accuracy":"69.5","Top-5 Accuracy":"91.9"},"paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","paper_date":"2022-07-24","code_links":[{"title":"alibaba-mmai-research/masked-action-recognition","url":"https://github.com/alibaba-mmai-research/masked-action-recognition"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30009,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"ORViT Mformer-L (ORViT blocks)","metrics":{"GFLOPs":"N/A","Parameters":"N/A","Top-1 Accuracy":"69.5","Top-5 Accuracy":"91.5"},"paper_url":"https://arxiv.org/abs/2110.06915v3","paper_title":"Object-Region Video Transformers","paper_date":"2021-10-13","code_links":[{"title":"eladb3/orvit","url":"https://github.com/eladb3/orvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30010,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"UniFormer-S (IN-1K + Kinetics600 pretrain)","metrics":{"GFLOPs":"41.8x3","Parameters":"21.4","Top-1 Accuracy":"69.4","Top-5 Accuracy":"92.1"},"paper_url":"https://openreview.net/forum?id=nBU_u6DLvoK","paper_title":"UniFormer: Unified Transformer for Efficient Spatial-Temporal Representation Learning","paper_date":"2021-09-29","code_links":[{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"sense-x/uniformer","url":"https://github.com/sense-x/uniformer"},{"title":"lucidrains/uniformer-pytorch","url":"https://github.com/lucidrains/uniformer-pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30011,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MML (ensemble)","metrics":{"Top-1 Accuracy":"69.02","Top-5 Accuracy":"92.70"},"paper_url":"https://arxiv.org/abs/2011.02543v1","paper_title":"Mutual Modality Learning for Video Action Classification","paper_date":"2020-11-04","code_links":[{"title":"papermsucode/mutual-modality-learning","url":"https://github.com/papermsucode/mutual-modality-learning"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30012,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MViT-B-24, 32x3","metrics":{"GFLOPs":"236x3","Parameters":"53.2M","Top-1 Accuracy":"68.7","Top-5 Accuracy":"91.5"},"paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","paper_date":"2021-04-22","code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"facebookresearch/pytorchvideo","url":"https://github.com/facebookresearch/pytorchvideo"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/hiera","url":"https://github.com/facebookresearch/hiera"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"wangjk666/stts","url":"https://github.com/wangjk666/stts"},{"title":"junweiliang/multitrain","url":"https://github.com/junweiliang/multitrain"},{"title":"rohanshad/cmr_transformer","url":"https://github.com/rohanshad/cmr_transformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30013,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MTV-B","metrics":{"Top-1 Accuracy":"68.5","Top-5 Accuracy":"90.4"},"paper_url":"https://arxiv.org/abs/2201.04288v4","paper_title":"Multiview Transformers for Video Recognition","paper_date":"2022-01-12","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30014,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MLP-3D","metrics":{"Top-1 Accuracy":"68.5"},"paper_url":"https://arxiv.org/abs/2206.06292v1","paper_title":"MLP-3D: A MLP-like 3D Architecture with Grouped Time Mixing","paper_date":"2022-06-13","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30015,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TDN ResNet101 (one clip, center crop, 8+16 ensemble, ImageNet pretrained, RGB only)","metrics":{"GFLOPs":"198x1","Top-1 Accuracy":"68.2","Top-5 Accuracy":"91.6"},"paper_url":"https://arxiv.org/abs/2012.10071v2","paper_title":"TDN: Temporal Difference Networks for Efficient Action Recognition","paper_date":"2020-12-18","code_links":[{"title":"MCG-NJU/TDN","url":"https://github.com/MCG-NJU/TDN"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30016,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MSMA (8+16frames)","metrics":{"Top-1 Accuracy":"68.2"},"paper_url":"https://link.springer.com/chapter/10.1007/978-3-031-25075-0_40","paper_title":"Multi-scale Motion-Aware Module for Video Action Recognition","paper_date":"2023-02-19","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30017,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"Mformer-L","metrics":{"GFLOPs":"1181x3","Parameters":"N/A","Top-1 Accuracy":"68.1","Top-5 Accuracy":"91.2"},"paper_url":"https://arxiv.org/abs/2106.05392v2","paper_title":"Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers","paper_date":"2021-06-09","code_links":[{"title":"facebookresearch/xformers","url":"https://github.com/facebookresearch/xformers"},{"title":"facebookresearch/Motionformer","url":"https://github.com/facebookresearch/Motionformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30018,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"VIMPAC","metrics":{"Top-1 Accuracy":"68.1"},"paper_url":"https://arxiv.org/abs/2106.11250v1","paper_title":"VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning","paper_date":"2021-06-21","code_links":[{"title":"airsplay/vimpac","url":"https://github.com/airsplay/vimpac"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30019,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"ORViT Mformer (ORViT blocks)","metrics":{"GFLOPs":"N/A","Parameters":"N/A","Top-1 Accuracy":"67.9","Top-5 Accuracy":"90.5"},"paper_url":"https://arxiv.org/abs/2110.06915v3","paper_title":"Object-Region Video Transformers","paper_date":"2021-10-13","code_links":[{"title":"eladb3/orvit","url":"https://github.com/eladb3/orvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30020,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MViT-B, 32x3(Kinetics600 pretrain)","metrics":{"GFLOPs":"170x3","Parameters":"36.6","Top-1 Accuracy":"67.8","Top-5 Accuracy":"91.3"},"paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","paper_date":"2021-04-22","code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"facebookresearch/pytorchvideo","url":"https://github.com/facebookresearch/pytorchvideo"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/hiera","url":"https://github.com/facebookresearch/hiera"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"wangjk666/stts","url":"https://github.com/wangjk666/stts"},{"title":"junweiliang/multitrain","url":"https://github.com/junweiliang/multitrain"},{"title":"rohanshad/cmr_transformer","url":"https://github.com/rohanshad/cmr_transformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30021,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"GC-TDN Ensemble (R50,8+16)","metrics":{"GFLOPs":"110.1","Parameters":"27.4","Top-1 Accuracy":"67.8","Top-5 Accuracy":"91.2"},"paper_url":"https://arxiv.org/abs/2203.09694v1","paper_title":"Group Contextualization for Video Recognition","paper_date":"2022-03-18","code_links":[{"title":"haoyanbin918/group-contextualization","url":"https://github.com/haoyanbin918/group-contextualization"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30022,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"CT-Net Ensemble (R50, 8+12+16+24)","metrics":{"GFLOPs":"280","Parameters":"83.8","Top-1 Accuracy":"67.8","Top-5 Accuracy":"91.1"},"paper_url":"https://arxiv.org/abs/2106.01603v1","paper_title":"CT-Net: Channel Tensorization Network for Video Classification","paper_date":"2021-06-03","code_links":[{"title":"Andy1621/CT-Net","url":"https://github.com/Andy1621/CT-Net"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30023,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TCM (Ensemble)","metrics":{"Top-1 Accuracy":"67.8"},"paper_url":"https://arxiv.org/abs/2202.12116v2","paper_title":"Motion-driven Visual Tempo Learning for Video-based Action Recognition","paper_date":"2022-02-24","code_links":[{"title":"yzfly/tcm","url":"https://github.com/yzfly/tcm"},{"title":"zphyix/tcm","url":"https://github.com/zphyix/tcm"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30024,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"SELFYNet-TSM-R50En (8+16 frames, ImageNet pretrained, 2 clips)","metrics":{"Top-1 Accuracy":"67.7","Top-5 Accuracy":"91.1"},"paper_url":"https://arxiv.org/abs/2102.07092v3","paper_title":"Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition","paper_date":"2021-02-14","code_links":[{"title":"arunos728/SELFY","url":"https://github.com/arunos728/SELFY"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30025,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"RSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips","metrics":{"Top-1 Accuracy":"67.7","Top-5 Accuracy":"91.1"},"paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","paper_date":"2021-11-02","code_links":[{"title":"KimManjin/RSA","url":"https://github.com/KimManjin/RSA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30026,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"GTDNet","metrics":{"Top-1 Accuracy":"67.6"},"paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=9961904","paper_title":"Global Temporal Difference Network for Action Recognition","paper_date":"2022-11-23","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30027,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"SELFYNet-TSM-R50En (8+16 frames, ImageNet pretrained, a single clip)","metrics":{"Top-1 Accuracy":"67.4","Top-5 Accuracy":"91"},"paper_url":"https://arxiv.org/abs/2102.07092v3","paper_title":"Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition","paper_date":"2021-02-14","code_links":[{"title":"arunos728/SELFY","url":"https://github.com/arunos728/SELFY"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30028,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"VoV3D-L (32frames, Kinetics pretrained, single)","metrics":{"GFLOPs":"20.9x6","Parameters":"5.8M","Top-1 Accuracy":"67.35","Top-5 Accuracy":"90.50"},"paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","paper_date":"2020-12-01","code_links":[{"title":"youngwanLEE/VoV3D","url":"https://github.com/youngwanLEE/VoV3D"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30029,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"PLAR","metrics":{"Top-1 Accuracy":"67.3","Top-5 Accuracy":"91"},"paper_url":"https://arxiv.org/abs/2305.12437v4","paper_title":"SCP: Soft Conditional Prompt Learning for Aerial Video Action Recognition","paper_date":"2023-05-21","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30030,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"RSANet-R50 (8+16 frames, ImageNet pretrained, a single clip)","metrics":{"Top-1 Accuracy":"67.3","Top-5 Accuracy":"90.8"},"paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","paper_date":"2021-11-02","code_links":[{"title":"KimManjin/RSA","url":"https://github.com/KimManjin/RSA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30031,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"X-Vit (x16)","metrics":{"GFLOPs":"850x1","Parameters":"N/A","Top-1 Accuracy":"67.2","Top-5 Accuracy":"90.8"},"paper_url":"https://arxiv.org/abs/2106.05968v2","paper_title":"Space-time Mixing Attention for Video Transformer","paper_date":"2021-06-10","code_links":[{"title":"1adrianb/video-transformers","url":"https://github.com/1adrianb/video-transformers"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30032,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TAda2D-En (ResNet-50, 8+16 frames)","metrics":{"Top-1 Accuracy":"67.2","Top-5 Accuracy":"89.8"},"paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","paper_date":"2021-10-12","code_links":[{"title":"alibaba-mmai-research/TAdaConv","url":"https://github.com/alibaba-mmai-research/TAdaConv"},{"title":"alibaba-mmai-research/pytorch-video-understanding","url":"https://github.com/alibaba-mmai-research/pytorch-video-understanding"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30033,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"Mformer-HR","metrics":{"GFLOPs":"958.8x3","Parameters":"N/A","Top-1 Accuracy":"67.1","Top-5 Accuracy":"90.6"},"paper_url":"https://arxiv.org/abs/2106.05392v2","paper_title":"Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers","paper_date":"2021-06-09","code_links":[{"title":"facebookresearch/xformers","url":"https://github.com/facebookresearch/xformers"},{"title":"facebookresearch/Motionformer","url":"https://github.com/facebookresearch/Motionformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30034,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TAdaConvNeXt-T","metrics":{"Top-1 Accuracy":"67.1","Top-5 Accuracy":"90.4"},"paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","paper_date":"2021-10-12","code_links":[{"title":"alibaba-mmai-research/TAdaConv","url":"https://github.com/alibaba-mmai-research/TAdaConv"},{"title":"alibaba-mmai-research/pytorch-video-understanding","url":"https://github.com/alibaba-mmai-research/pytorch-video-understanding"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30035,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MoDS (8+16frames)","metrics":{"Top-1 Accuracy":"67.1"},"paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?arnumber=9831068","paper_title":"Action Recognition With Motion Diversification and Dynamic Selection","paper_date":"2022-07-15","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30036,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"STPG (8+16frames)","metrics":{"Top-1 Accuracy":"67.0"},"paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=9852978","paper_title":"Spatial-Temporal Pyramid Graph Reasoning for Action Recognition","paper_date":"2022-08-09","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30037,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MML (single)","metrics":{"Top-1 Accuracy":"66.83","Top-5 Accuracy":"91.30"},"paper_url":"https://arxiv.org/abs/2011.02543v1","paper_title":"Mutual Modality Learning for Video Action Classification","paper_date":"2020-11-04","code_links":[{"title":"papermsucode/mutual-modality-learning","url":"https://github.com/papermsucode/mutual-modality-learning"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30038,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"ILA (ViT-B/16)","metrics":{"Top-1 Accuracy":"66.8","Top-5 Accuracy":"90.3"},"paper_url":"https://arxiv.org/abs/2304.10465v2","paper_title":"Implicit Temporal Modeling with Learnable Alignment for Video Recognition","paper_date":"2023-04-20","code_links":[{"title":"francis-rings/ila","url":"https://github.com/francis-rings/ila"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30039,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TSM (RGB + Flow)","metrics":{"Top-1 Accuracy":"66.6","Top-5 Accuracy":"91.3"},"paper_url":"https://arxiv.org/abs/1811.08383v3","paper_title":"TSM: Temporal Shift Module for Efficient Video Understanding","paper_date":"2018-11-20","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee/tree/main/towhee/models/tsm"},{"title":"MIT-HAN-LAB/temporal-shift-module","url":"https://github.com/MIT-HAN-LAB/temporal-shift-module"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/recognition/pp-tsm.md"},{"title":"mindspore-ai/models","url":"https://github.com/mindspore-ai/models/tree/master/research/cv/tsm"},{"title":"bespontaneous/ffn","url":"https://github.com/bespontaneous/ffn"},{"title":"bespontaneous/mca-pytorch","url":"https://github.com/bespontaneous/mca-pytorch"},{"title":"PaParaZz1/TemporalShiftModule","url":"https://github.com/PaParaZz1/TemporalShiftModule"},{"title":"WavesUR/embedded_TSM","url":"https://github.com/WavesUR/embedded_TSM"},{"title":"sunutf/TSM","url":"https://github.com/sunutf/TSM"},{"title":"niveditarahurkar/CS231N-ActionRecognition","url":"https://github.com/niveditarahurkar/CS231N-ActionRecognition"},{"title":"stevedepp/yolo4asl","url":"https://github.com/stevedepp/yolo4asl"},{"title":"rijuldhir/TSM","url":"https://github.com/rijuldhir/TSM"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30040,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MSNet-R50En (8+16 ensemble, ImageNet pretrained)","metrics":{"Top-1 Accuracy":"66.6","Top-5 Accuracy":"90.6"},"paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","paper_date":"2020-07-20","code_links":[{"title":"arunos728/MotionSqueeze","url":"https://github.com/arunos728/MotionSqueeze"},{"title":"arunos728/arunos728.github.io","url":"https://github.com/arunos728/arunos728.github.io"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30041,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"PAN ResNet101 (RGB only, no Flow)","metrics":{"Top-1 Accuracy":"66.5","Top-5 Accuracy":"90.6"},"paper_url":"https://arxiv.org/abs/2008.03462v1","paper_title":"PAN: Towards Fast Action Recognition via Learning Persistence of Appearance","paper_date":"2020-08-08","code_links":[{"title":"zhang-can/PAN-PyTorch","url":"https://github.com/zhang-can/PAN-PyTorch"},{"title":"tianyuan168326/EAN-Pytorch","url":"https://github.com/tianyuan168326/EAN-Pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30042,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TSM+W3 (16 frames, RGB ResNet-50)","metrics":{"Top-1 Accuracy":"66.5","Top-5 Accuracy":"90.4"},"paper_url":"https://arxiv.org/abs/2004.01278v1","paper_title":"Knowing What, Where and When to Look: Efficient Video Action Modeling with Attention","paper_date":"2020-04-02","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30043,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"Mformer","metrics":{"Top-1 Accuracy":"66.5","Top-5 Accuracy":"90.1"},"paper_url":"https://arxiv.org/abs/2106.05392v2","paper_title":"Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers","paper_date":"2021-06-09","code_links":[{"title":"facebookresearch/xformers","url":"https://github.com/facebookresearch/xformers"},{"title":"facebookresearch/Motionformer","url":"https://github.com/facebookresearch/Motionformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30044,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MVFNet-ResNet50 (center crop, 8+16 ensemble, ImageNet pretrained, RGB only)","metrics":{"Top-1 Accuracy":"66.3"},"paper_url":"https://arxiv.org/abs/2012.06977v2","paper_title":"MVFNet: Multi-View Fusion Network for Efficient Video Recognition","paper_date":"2020-12-13","code_links":[{"title":"whwu95/MVFNet","url":"https://github.com/whwu95/MVFNet"},{"title":"whwu95/DSANet","url":"https://github.com/whwu95/DSANet"},{"title":"txyugood/PaddleMVF","url":"https://github.com/txyugood/PaddleMVF"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30045,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MViT-B, 16x4","metrics":{"Top-1 Accuracy":"66.2","Top-5 Accuracy":"90.2"},"paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","paper_date":"2021-04-22","code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"facebookresearch/pytorchvideo","url":"https://github.com/facebookresearch/pytorchvideo"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/hiera","url":"https://github.com/facebookresearch/hiera"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"wangjk666/stts","url":"https://github.com/wangjk666/stts"},{"title":"junweiliang/multitrain","url":"https://github.com/junweiliang/multitrain"},{"title":"rohanshad/cmr_transformer","url":"https://github.com/rohanshad/cmr_transformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30046,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"RSANet-R50 (16 frames, ImageNet pretrained, a single clip)","metrics":{"Top-1 Accuracy":"66","Top-5 Accuracy":"89.8"},"paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","paper_date":"2021-11-02","code_links":[{"title":"KimManjin/RSA","url":"https://github.com/KimManjin/RSA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30047,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"VoV3D-L (32frames, from scratch, single)","metrics":{"GFLOPs":"20.9x6","Parameters":"5.8M","Top-1 Accuracy":"65.8","Top-5 Accuracy":"89.5"},"paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","paper_date":"2020-12-01","code_links":[{"title":"youngwanLEE/VoV3D","url":"https://github.com/youngwanLEE/VoV3D"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30048,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"E3D-L","metrics":{"GFLOPs":"18.3","Top-1 Accuracy":"65.7","Top-5 Accuracy":"89.8"},"paper_url":"https://arxiv.org/abs/2303.02693v1","paper_title":"Maximizing Spatio-Temporal Entropy of Deep 3D CNNs for Efficient Video Recognition","paper_date":"2023-03-05","code_links":[{"title":"alibaba/lightweight-neural-architecture-search","url":"https://github.com/alibaba/lightweight-neural-architecture-search"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30049,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"SELFYNet-TSM-R50 (16 frames, ImageNet pretrained)","metrics":{"Top-1 Accuracy":"65.7","Top-5 Accuracy":"89.8"},"paper_url":"https://arxiv.org/abs/2102.07092v3","paper_title":"Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition","paper_date":"2021-02-14","code_links":[{"title":"arunos728/SELFY","url":"https://github.com/arunos728/SELFY"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30050,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TAda2D (ResNet-50, 16 frames)","metrics":{"Top-1 Accuracy":"65.6","Top-5 Accuracy":"89.2"},"paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","paper_date":"2021-10-12","code_links":[{"title":"alibaba-mmai-research/TAdaConv","url":"https://github.com/alibaba-mmai-research/TAdaConv"},{"title":"alibaba-mmai-research/pytorch-video-understanding","url":"https://github.com/alibaba-mmai-research/pytorch-video-understanding"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30051,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"ViViT-L/16x2 Fact. encoder","metrics":{"Top-1 Accuracy":"65.4","Top-5 Accuracy":"89.8"},"paper_url":"https://arxiv.org/abs/2103.15691v2","paper_title":"ViViT: A Video Vision Transformer","paper_date":"2021-03-29","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"},{"title":"keras-team/keras-io","url":"https://github.com/keras-team/keras-io/blob/master/examples/vision/vivit.py"},{"title":"rishikksh20/ViViT-pytorch","url":"https://github.com/rishikksh20/ViViT-pytorch"},{"title":"mx-mark/videotransformer-pytorch","url":"https://github.com/mx-mark/videotransformer-pytorch"},{"title":"SforAiDl/vformer","url":"https://github.com/SforAiDl/vformer"},{"title":"drv-agwl/ViViT-pytorch","url":"https://github.com/drv-agwl/ViViT-pytorch"},{"title":"KSonPham/ViVit-a-Pytorch-implementation","url":"https://github.com/KSonPham/ViVit-a-Pytorch-implementation"},{"title":"Abdulrahman-Adel/Real-Life-Violence-Detection","url":"https://github.com/Abdulrahman-Adel/Real-Life-Violence-Detection"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/vivit"},{"title":"MS-P3/code7","url":"https://github.com/MS-P3/code7/tree/main/vivit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30052,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"VoV3D-M (32frames, Kinetics pretrained, single)","metrics":{"GFLOPs":"11.5x6","Parameters":"3.3M","Top-1 Accuracy":"65.24","Top-5 Accuracy":"89.48"},"paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","paper_date":"2020-12-01","code_links":[{"title":"youngwanLEE/VoV3D","url":"https://github.com/youngwanLEE/VoV3D"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30053,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"bLVNet","metrics":{"Top-1 Accuracy":"65.2"},"paper_url":"https://arxiv.org/abs/1912.00869v1","paper_title":"More Is Less: Learning Efficient Video Representations by Big-Little Network and Depthwise Temporal Aggregation","paper_date":"2019-12-02","code_links":[{"title":"IBM/bLVNet-TAM","url":"https://github.com/IBM/bLVNet-TAM"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30054,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"DirecFormer","metrics":{"Top-1 Accuracy":"64.94","Top-5 Accuracy":"87.9"},"paper_url":"https://arxiv.org/abs/2203.10233v1","paper_title":"DirecFormer: A Directed Attention in Transformer Approach to Robust Action Recognition","paper_date":"2022-03-19","code_links":[{"title":"uark-cviu/direcformer","url":"https://github.com/uark-cviu/direcformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30055,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"RSANet-R50 (8 frames, ImageNet pretrained, a single clip)","metrics":{"Top-1 Accuracy":"64.8","Top-5 Accuracy":"89.1"},"paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","paper_date":"2021-11-02","code_links":[{"title":"KimManjin/RSA","url":"https://github.com/KimManjin/RSA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30056,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MSNet-R50 (16 frames, ImageNet pretrained)","metrics":{"Top-1 Accuracy":"64.7","Top-5 Accuracy":"89.4"},"paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","paper_date":"2020-07-20","code_links":[{"title":"arunos728/MotionSqueeze","url":"https://github.com/arunos728/MotionSqueeze"},{"title":"arunos728/arunos728.github.io","url":"https://github.com/arunos728/arunos728.github.io"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30057,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"AK-Net","metrics":{"Top-1 Accuracy":"64.3"},"paper_url":"https://arxiv.org/abs/2201.06304v1","paper_title":"Action Keypoint Network for Efficient Video Recognition","paper_date":"2022-01-17","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30058,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"VoV3D-M (32frames, from scratch, single)","metrics":{"GFLOPs":"11.5x6","Parameters":"3.3M","Top-1 Accuracy":"64.2","Top-5 Accuracy":"88.8"},"paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","paper_date":"2020-12-01","code_links":[{"title":"youngwanLEE/VoV3D","url":"https://github.com/youngwanLEE/VoV3D"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30059,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"VoV3D-L (16frames, from scratch, single)","metrics":{"GFLOPs":"9.3x6","Parameters":"5.8M","Top-1 Accuracy":"64.1","Top-5 Accuracy":"88.6"},"paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","paper_date":"2020-12-01","code_links":[{"title":"youngwanLEE/VoV3D","url":"https://github.com/youngwanLEE/VoV3D"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30060,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TAda2D (ResNet-50, 8 frames)","metrics":{"Top-1 Accuracy":"64.0","Top-5 Accuracy":"88.0"},"paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","paper_date":"2021-10-12","code_links":[{"title":"alibaba-mmai-research/TAdaConv","url":"https://github.com/alibaba-mmai-research/TAdaConv"},{"title":"alibaba-mmai-research/pytorch-video-understanding","url":"https://github.com/alibaba-mmai-research/pytorch-video-understanding"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30061,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MoViNet-A2","metrics":{"GFLOPs":"10.3x1","Parameters":"4.8M","Top-1 Accuracy":"63.5","Top-5 Accuracy":"89.0"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30062,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"VoV3D-M (16frames, from scratch, single)","metrics":{"GFLOPs":"5.7x6","Parameters":"3.3M","Top-1 Accuracy":"63.2","Top-5 Accuracy":"88.2"},"paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","paper_date":"2020-12-01","code_links":[{"title":"youngwanLEE/VoV3D","url":"https://github.com/youngwanLEE/VoV3D"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30063,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MSNet-R50 (8 frames, ImageNet pretrained)","metrics":{"Top-1 Accuracy":"63","Top-5 Accuracy":"88.4"},"paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","paper_date":"2020-07-20","code_links":[{"title":"arunos728/MotionSqueeze","url":"https://github.com/arunos728/MotionSqueeze"},{"title":"arunos728/arunos728.github.io","url":"https://github.com/arunos728/arunos728.github.io"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30064,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MoViNet-A1","metrics":{"GFLOPs":"6.0x1","Parameters":"4.6M","Top-1 Accuracy":"62.7","Top-5 Accuracy":"89.0"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30065,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"OmniVL","metrics":{"Top-1 Accuracy":"62.5","Top-5 Accuracy":"86.2"},"paper_url":"https://arxiv.org/abs/2209.07526v2","paper_title":"OmniVL:One Foundation Model for Image-Language and Video-Language Tasks","paper_date":"2022-09-15","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30066,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TimeSformer-HR","metrics":{"Top-1 Accuracy":"62.5"},"paper_url":"https://arxiv.org/abs/2102.05095v4","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","paper_date":"2021-02-09","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/TimeSformer","url":"https://github.com/facebookresearch/TimeSformer"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/recognition/timesformer.md"},{"title":"The-AI-Summer/self-attention-cv","url":"https://github.com/The-AI-Summer/self-attention-cv"},{"title":"lucidrains/TimeSformer-pytorch","url":"https://github.com/lucidrains/TimeSformer-pytorch"},{"title":"mx-mark/videotransformer-pytorch","url":"https://github.com/mx-mark/videotransformer-pytorch"},{"title":"jerrywn121/TianChi_AIEarth","url":"https://github.com/jerrywn121/TianChi_AIEarth"},{"title":"davide-coccomini/TimeSformer-Video-Classification","url":"https://github.com/davide-coccomini/TimeSformer-Video-Classification"},{"title":"yiyixuxu/TimeSformer-rolled-attention","url":"https://github.com/yiyixuxu/TimeSformer-rolled-attention"},{"title":"m-bain/video-transformers","url":"https://github.com/m-bain/video-transformers"},{"title":"md-mohaiminul/objectstatechange","url":"https://github.com/md-mohaiminul/objectstatechange"},{"title":"MindCode-4/code-5","url":"https://github.com/MindCode-4/code-5/tree/main/timesformer"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/timesformer"},{"title":"pwc-1/Paper-10","url":"https://github.com/pwc-1/Paper-10/tree/main/timesformer"},{"title":"halixness/generative_timesformer_pytorch","url":"https://github.com/halixness/generative_timesformer_pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30067,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TimeSformer-L","metrics":{"Top-1 Accuracy":"62.3"},"paper_url":"https://arxiv.org/abs/2102.05095v4","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","paper_date":"2021-02-09","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/TimeSformer","url":"https://github.com/facebookresearch/TimeSformer"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/recognition/timesformer.md"},{"title":"The-AI-Summer/self-attention-cv","url":"https://github.com/The-AI-Summer/self-attention-cv"},{"title":"lucidrains/TimeSformer-pytorch","url":"https://github.com/lucidrains/TimeSformer-pytorch"},{"title":"mx-mark/videotransformer-pytorch","url":"https://github.com/mx-mark/videotransformer-pytorch"},{"title":"jerrywn121/TianChi_AIEarth","url":"https://github.com/jerrywn121/TianChi_AIEarth"},{"title":"davide-coccomini/TimeSformer-Video-Classification","url":"https://github.com/davide-coccomini/TimeSformer-Video-Classification"},{"title":"yiyixuxu/TimeSformer-rolled-attention","url":"https://github.com/yiyixuxu/TimeSformer-rolled-attention"},{"title":"m-bain/video-transformers","url":"https://github.com/m-bain/video-transformers"},{"title":"md-mohaiminul/objectstatechange","url":"https://github.com/md-mohaiminul/objectstatechange"},{"title":"MindCode-4/code-5","url":"https://github.com/MindCode-4/code-5/tree/main/timesformer"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/timesformer"},{"title":"pwc-1/Paper-10","url":"https://github.com/pwc-1/Paper-10/tree/main/timesformer"},{"title":"halixness/generative_timesformer_pytorch","url":"https://github.com/halixness/generative_timesformer_pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30068,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TRG (ResNet-50)","metrics":{"Top-1 Accuracy":"62.2","Top-5 Accuracy":"90.3"},"paper_url":"https://arxiv.org/abs/1908.09995v1","paper_title":"Temporal Reasoning Graph for Activity Recognition","paper_date":"2019-08-27","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30069,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TPN (TSM-50)","metrics":{"Top-1 Accuracy":"62.0"},"paper_url":"https://arxiv.org/abs/2004.03548v2","paper_title":"Temporal Pyramid Network for Action Recognition","paper_date":"2020-04-07","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"decisionforce/TPN","url":"https://github.com/decisionforce/TPN"},{"title":"Zengxianxian727/TPN_paddle","url":"https://github.com/Zengxianxian727/TPN_paddle"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30070,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"Multigrid","metrics":{"Top-1 Accuracy":"61.7"},"paper_url":"https://arxiv.org/abs/1912.00998v2","paper_title":"A Multigrid Method for Efficiently Training Video Models","paper_date":"2019-12-02","code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"kkahatapitiya/X3D-Multigrid","url":"https://github.com/kkahatapitiya/X3D-Multigrid"},{"title":"alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates","url":"https://github.com/alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30071,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"SlowFast","metrics":{"Top-1 Accuracy":"61.7"},"paper_url":"https://arxiv.org/abs/1812.03982v3","paper_title":"SlowFast Networks for Video Recognition","paper_date":"2018-12-10","code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"facebookresearch/pytorchvideo","url":"https://github.com/facebookresearch/pytorchvideo"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/recognition/slowfast.md"},{"title":"wangxiang1230/SSTAP","url":"https://github.com/wangxiang1230/SSTAP"},{"title":"tianfr/mononerf","url":"https://github.com/tianfr/mononerf"},{"title":"LukasHedegaard/co3d","url":"https://github.com/LukasHedegaard/co3d"},{"title":"tonysy/PyAction","url":"https://github.com/tonysy/PyAction"},{"title":"tianfr/semantic-flow","url":"https://github.com/tianfr/semantic-flow"},{"title":"jihun-kr/SlowFast","url":"https://github.com/jihun-kr/SlowFast"},{"title":"youngjun0627/movie-rating","url":"https://github.com/youngjun0627/movie-rating"},{"title":"chaitanyadwivedii/3D-Attention-is-All-You-Need","url":"https://github.com/chaitanyadwivedii/3D-Attention-is-All-You-Need"},{"title":"Mind23-2/MindCode-88","url":"https://github.com/Mind23-2/MindCode-88/tree/main/slowfast"},{"title":"Ysp9714/SlowFastNet-keras","url":"https://github.com/Ysp9714/SlowFastNet-keras"},{"title":"2023-MindSpore-4/Code7","url":"https://github.com/2023-MindSpore-4/Code7/tree/main/slowfast"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30072,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TRG (Inception-V3)","metrics":{"Top-1 Accuracy":"61.3","Top-5 Accuracy":"91.4"},"paper_url":"https://arxiv.org/abs/1908.09995v1","paper_title":"Temporal Reasoning Graph for Activity Recognition","paper_date":"2019-08-27","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30073,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MoViNet-A0","metrics":{"GFLOPs":"2.7x1","Parameters":"3.1M","Top-1 Accuracy":"61.3","Top-5 Accuracy":"88.2"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30074,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"CCS + two-stream + TRN","metrics":{"Top-1 Accuracy":"61.2","Top-5 Accuracy":"89.3"},"paper_url":"https://arxiv.org/abs/1908.10136v1","paper_title":"Cooperative Cross-Stream Network for Discriminative Action Representation","paper_date":"2019-08-27","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30075,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"VidTr-L","metrics":{"Top-1 Accuracy":"60.2"},"paper_url":"https://arxiv.org/abs/2104.11746v2","paper_title":"VidTr: Video Transformer Without Convolutions","paper_date":"2021-04-23","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30076,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TimeSformer","metrics":{"Top-1 Accuracy":"59.5"},"paper_url":"https://arxiv.org/abs/2102.05095v4","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","paper_date":"2021-02-09","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/TimeSformer","url":"https://github.com/facebookresearch/TimeSformer"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/recognition/timesformer.md"},{"title":"The-AI-Summer/self-attention-cv","url":"https://github.com/The-AI-Summer/self-attention-cv"},{"title":"lucidrains/TimeSformer-pytorch","url":"https://github.com/lucidrains/TimeSformer-pytorch"},{"title":"mx-mark/videotransformer-pytorch","url":"https://github.com/mx-mark/videotransformer-pytorch"},{"title":"jerrywn121/TianChi_AIEarth","url":"https://github.com/jerrywn121/TianChi_AIEarth"},{"title":"davide-coccomini/TimeSformer-Video-Classification","url":"https://github.com/davide-coccomini/TimeSformer-Video-Classification"},{"title":"yiyixuxu/TimeSformer-rolled-attention","url":"https://github.com/yiyixuxu/TimeSformer-rolled-attention"},{"title":"m-bain/video-transformers","url":"https://github.com/m-bain/video-transformers"},{"title":"md-mohaiminul/objectstatechange","url":"https://github.com/md-mohaiminul/objectstatechange"},{"title":"MindCode-4/code-5","url":"https://github.com/MindCode-4/code-5/tree/main/timesformer"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/timesformer"},{"title":"pwc-1/Paper-10","url":"https://github.com/pwc-1/Paper-10/tree/main/timesformer"},{"title":"halixness/generative_timesformer_pytorch","url":"https://github.com/halixness/generative_timesformer_pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30077,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"SVT","metrics":{"Top-1 Accuracy":"59.2"},"paper_url":"https://arxiv.org/abs/2112.01514v2","paper_title":"Self-supervised Video Transformer","paper_date":"2021-12-02","code_links":[{"title":"kahnchana/svt","url":"https://github.com/kahnchana/svt"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30078,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"TAM (5-shot)","metrics":{"Top-1 Accuracy":"52.3"},"paper_url":"https://arxiv.org/abs/1906.11415v1","paper_title":"Few-Shot Video Classification via Temporal Alignment","paper_date":"2019-06-27","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30079,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"model3D_1 with left-right augmentation and fps jitter","metrics":{"Top-1 Accuracy":"51.33","Top-5 Accuracy":"80.46"},"paper_url":"http://arxiv.org/abs/1706.04261v2","paper_title":"The \"something something\" video database for learning and evaluating visual common sense","paper_date":"2017-06-13","code_links":[{"title":"jayleicn/singularity","url":"https://github.com/jayleicn/singularity"},{"title":"bit-ml/dyreg-gnn","url":"https://github.com/bit-ml/dyreg-gnn"},{"title":"caspillaga/Conv3DSelfAttention","url":"https://github.com/caspillaga/Conv3DSelfAttention"},{"title":"akshyta/Human-Activity-Recognition","url":"https://github.com/akshyta/Human-Activity-Recognition"},{"title":"latte488/smth-smth-v2","url":"https://github.com/latte488/smth-smth-v2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30080,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"Prob-Distill","metrics":{"Top-1 Accuracy":"49.9","Top-5 Accuracy":"79.1"},"paper_url":"https://arxiv.org/abs/1904.03249v2","paper_title":"Attention Distillation for Learning Video Representations","paper_date":"2019-04-05","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30081,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"STM + TRNMultiscale","metrics":{"Top-1 Accuracy":"47.73"},"paper_url":"https://arxiv.org/abs/1909.05165v2","paper_title":"Comparative Analysis of CNN-based Spatiotemporal Reasoning in Videos","paper_date":"2019-09-11","code_links":[{"title":"fubel/stmodeling","url":"https://github.com/fubel/stmodeling"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":590129,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TrAction","metrics":{"Top-1 Accuracy":"45"},"paper_url":"https://paperswithcode.com/paper/traction-action-recognition-with-sparse-trajectories","paper_title":"TrAction: Action Recognition with Sparse Trajectories","paper_date":"2026-06-02","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":30082,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"InternVideo2-6B","metrics":{"GFLOPs":"13321","Parameters":"2131","Top-1 Accuracy":"1","Top-5 Accuracy":"12"},"paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_date":"2024-03-22","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":30083,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MViTv2-B (IN-21K + Kinetics400 pretrain)","metrics":{"Parameters":"51.1","Top-5 Accuracy":"93.4"},"paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","paper_date":"2021-12-02","code_links":[{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"facebookresearch/detectron2","url":"https://github.com/facebookresearch/detectron2/tree/main/projects/MViTv2"},{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"open-mmlab/mmclassification","url":"https://github.com/open-mmlab/mmclassification"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"JunweiLiang/aicity_action","url":"https://github.com/JunweiLiang/aicity_action"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"},{"title":"rajatmodi62/occludedactionbenchmark","url":"https://github.com/rajatmodi62/occludedactionbenchmark"},{"title":"3dperceptionlab/visual-wetlandbirds","url":"https://github.com/3dperceptionlab/visual-wetlandbirds"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30084,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"RSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips)","metrics":{"Top-5 Accuracy":"91.1"},"paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","paper_date":"2021-11-02","code_links":[{"title":"KimManjin/RSA","url":"https://github.com/KimManjin/RSA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30085,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MoViNet-A3","metrics":{"GFLOPs":"23.7x1","Parameters":"5.3M"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":30086,"task":"Action Recognition","parent_task":"Activity Recognition","dataset":"Something-Something V2","model_name":"MViT-L (IN-21K + Kinetics400 pretrain)","metrics":{"GFLOPs":"2828x3"},"paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","paper_date":"2021-12-02","code_links":[{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"facebookresearch/detectron2","url":"https://github.com/facebookresearch/detectron2/tree/main/projects/MViTv2"},{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"open-mmlab/mmclassification","url":"https://github.com/open-mmlab/mmclassification"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"JunweiLiang/aicity_action","url":"https://github.com/JunweiLiang/aicity_action"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"},{"title":"rajatmodi62/occludedactionbenchmark","url":"https://github.com/rajatmodi62/occludedactionbenchmark"},{"title":"3dperceptionlab/visual-wetlandbirds","url":"https://github.com/3dperceptionlab/visual-wetlandbirds"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92557,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MVD (Kinetics400 pretrain, ViT-H, 16 frame)","metrics":{"GFLOPs":"1192x6","Parameters":"633","Top-1 Accuracy":"77.3","Top-5 Accuracy":"95.7"},"paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","paper_date":"2022-12-08","code_links":[{"title":"ruiwang2021/mvd","url":"https://github.com/ruiwang2021/mvd"},{"title":"2023-MindSpore-4/Code-5","url":"https://github.com/2023-MindSpore-4/Code-5/tree/main/MVD"},{"title":"Mind23-2/MindCode-3","url":"https://github.com/Mind23-2/MindCode-3/tree/main/MVD"},{"title":"Mind23-2/MindCode-101","url":"https://github.com/Mind23-2/MindCode-101/tree/main/MVD"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92558,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"DejaVid","metrics":{"Top-1 Accuracy":"77.2","Top-5 Accuracy":"96.3"},"paper_url":"http://openaccess.thecvf.com//content/CVPR2025/html/Ho_DejaVid_Encoder-Agnostic_Learned_Temporal_Matching_for_Video_Classification_CVPR_2025_paper.html","paper_title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","paper_date":"2025-01-01","code_links":[{"title":"darrylho/dejavid","url":"https://github.com/darrylho/dejavid"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92559,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"InternVideo","metrics":{"Top-1 Accuracy":"77.2"},"paper_url":"https://arxiv.org/abs/2212.03191v2","paper_title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","paper_date":"2022-12-06","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"yingsen1/unimd","url":"https://github.com/yingsen1/unimd"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92560,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"InternVideo2-1B","metrics":{"Top-1 Accuracy":"77.1"},"paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_date":"2024-03-22","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92561,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"VideoMAE V2-g","metrics":{"GFLOPs":"2544x6","Parameters":"1013","Top-1 Accuracy":"77.0","Top-5 Accuracy":"95.9"},"paper_url":"https://arxiv.org/abs/2303.16727v2","paper_title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","paper_date":"2023-03-29","code_links":[{"title":"OpenGVLab/VideoMAEv2","url":"https://github.com/OpenGVLab/VideoMAEv2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92562,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MVD (Kinetics400 pretrain, ViT-L, 16 frame)","metrics":{"GFLOPs":"597x6","Parameters":"305","Top-1 Accuracy":"76.7","Top-5 Accuracy":"95.5"},"paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","paper_date":"2022-12-08","code_links":[{"title":"ruiwang2021/mvd","url":"https://github.com/ruiwang2021/mvd"},{"title":"2023-MindSpore-4/Code-5","url":"https://github.com/2023-MindSpore-4/Code-5/tree/main/MVD"},{"title":"Mind23-2/MindCode-3","url":"https://github.com/Mind23-2/MindCode-3/tree/main/MVD"},{"title":"Mind23-2/MindCode-101","url":"https://github.com/Mind23-2/MindCode-101/tree/main/MVD"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92563,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"Hiera-L (no extra data)","metrics":{"Top-1 Accuracy":"76.5"},"paper_url":"https://arxiv.org/abs/2306.00989v1","paper_title":"Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles","paper_date":"2023-06-01","code_links":[{"title":"huggingface/pytorch-image-models","url":"https://github.com/huggingface/pytorch-image-models"},{"title":"facebookresearch/hiera","url":"https://github.com/facebookresearch/hiera"},{"title":"leondgarse/keras_cv_attention_models","url":"https://github.com/leondgarse/keras_cv_attention_models/tree/main/keras_cv_attention_models/hiera"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92564,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TubeViT-L","metrics":{"Top-1 Accuracy":"76.1","Top-5 Accuracy":"95.2"},"paper_url":"https://arxiv.org/abs/2212.03229v1","paper_title":"Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video Learning","paper_date":"2022-12-06","code_links":[{"title":"daniel-code/TubeViT","url":"https://github.com/daniel-code/TubeViT"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92565,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"VideoMAE (no extra data, ViT-L, 32x2)","metrics":{"GFLOPs":"1436x3","Parameters":"305","Top-1 Accuracy":"75.4","Top-5 Accuracy":"95.2"},"paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","paper_date":"2022-03-23","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"MCG-NJU/VideoMAE","url":"https://github.com/MCG-NJU/VideoMAE"},{"title":"MCG-NJU/VideoMAE-Action-Detection","url":"https://github.com/MCG-NJU/VideoMAE-Action-Detection"},{"title":"innat/VideoMAE","url":"https://github.com/innat/VideoMAE"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/5/videomae"},{"title":"MS-P3/code7","url":"https://github.com/MS-P3/code7/tree/main/videomae"},{"title":"MindSpore-scientific/code-7","url":"https://github.com/MindSpore-scientific/code-7/tree/main/VideoMAE"},{"title":"MindCode-4/code-1","url":"https://github.com/MindCode-4/code-1/tree/main/videomae"},{"title":"MindSpore-scientific/code-13","url":"https://github.com/MindSpore-scientific/code-13/tree/main/token_learner"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92566,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"Side4Video (EVA ViT-E/14)","metrics":{"Top-1 Accuracy":"75.2","Top-5 Accuracy":"94.0"},"paper_url":"https://arxiv.org/abs/2311.15769v1","paper_title":"Side4Video: Spatial-Temporal Side Network for Memory-Efficient Image-to-Video Transfer Learning","paper_date":"2023-11-27","code_links":[{"title":"whwu95/ATM","url":"https://github.com/whwu95/ATM"},{"title":"HJYao00/Side4Video","url":"https://github.com/HJYao00/Side4Video"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92567,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MaskFeat (Kinetics600 pretrain, MViT-L)","metrics":{"GFLOPs":"2828*3","Parameters":"218","Top-1 Accuracy":"75.0","Top-5 Accuracy":"95.0"},"paper_url":"https://arxiv.org/abs/2112.09133v2","paper_title":"Masked Feature Prediction for Self-Supervised Visual Pre-Training","paper_date":"2021-12-16","code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"open-mmlab/mmselfsup","url":"https://github.com/open-mmlab/mmselfsup"},{"title":"Westlake-AI/openmixup","url":"https://github.com/Westlake-AI/openmixup"},{"title":"mx-mark/videotransformer-pytorch","url":"https://github.com/mx-mark/videotransformer-pytorch"},{"title":"mx-mark/dmjd","url":"https://github.com/mx-mark/dmjd"},{"title":"yyk-wew/semanticmim","url":"https://github.com/yyk-wew/semanticmim"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92568,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MAR (50% mask, ViT-L, 16x4)","metrics":{"GFLOPs":"276x6","Parameters":"311","Top-1 Accuracy":"74.7","Top-5 Accuracy":"94.9"},"paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","paper_date":"2022-07-24","code_links":[{"title":"alibaba-mmai-research/masked-action-recognition","url":"https://github.com/alibaba-mmai-research/masked-action-recognition"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92569,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"ATM","metrics":{"Top-1 Accuracy":"74.6","Top-5 Accuracy":"94.4"},"paper_url":"https://arxiv.org/abs/2307.08908v2","paper_title":"What Can Simple Arithmetic Operations Do for Temporal Modeling?","paper_date":"2023-07-18","code_links":[{"title":"whwu95/ATM","url":"https://github.com/whwu95/ATM"},{"title":"HJYao00/Side4Video","url":"https://github.com/HJYao00/Side4Video"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92570,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MAWS (ViT-L)","metrics":{"Top-1 Accuracy":"74.4"},"paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","paper_date":"2023-03-23","code_links":[{"title":"facebookresearch/maws","url":"https://github.com/facebookresearch/maws"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92571,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"VideoMAE (no extra data, ViT-L, 16frame)","metrics":{"GFLOPs":"597x6","Parameters":"305","Top-1 Accuracy":"74.3","Top-5 Accuracy":"94.6"},"paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","paper_date":"2022-03-23","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"MCG-NJU/VideoMAE","url":"https://github.com/MCG-NJU/VideoMAE"},{"title":"MCG-NJU/VideoMAE-Action-Detection","url":"https://github.com/MCG-NJU/VideoMAE-Action-Detection"},{"title":"innat/VideoMAE","url":"https://github.com/innat/VideoMAE"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/5/videomae"},{"title":"MS-P3/code7","url":"https://github.com/MS-P3/code7/tree/main/videomae"},{"title":"MindSpore-scientific/code-7","url":"https://github.com/MindSpore-scientific/code-7/tree/main/VideoMAE"},{"title":"MindCode-4/code-1","url":"https://github.com/MindCode-4/code-1/tree/main/videomae"},{"title":"MindSpore-scientific/code-13","url":"https://github.com/MindSpore-scientific/code-13/tree/main/token_learner"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92572,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MAR (75% mask, ViT-L, 16x4)","metrics":{"GFLOPs":"131x6","Parameters":"311","Top-1 Accuracy":"73.8","Top-5 Accuracy":"94.4"},"paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","paper_date":"2022-07-24","code_links":[{"title":"alibaba-mmai-research/masked-action-recognition","url":"https://github.com/alibaba-mmai-research/masked-action-recognition"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92573,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MVD (Kinetics400 pretrain, ViT-B, 16 frame)","metrics":{"GFLOPs":"180x6","Parameters":"87","Top-1 Accuracy":"73.7","Top-5 Accuracy":"94.0"},"paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","paper_date":"2022-12-08","code_links":[{"title":"ruiwang2021/mvd","url":"https://github.com/ruiwang2021/mvd"},{"title":"2023-MindSpore-4/Code-5","url":"https://github.com/2023-MindSpore-4/Code-5/tree/main/MVD"},{"title":"Mind23-2/MindCode-3","url":"https://github.com/Mind23-2/MindCode-3/tree/main/MVD"},{"title":"Mind23-2/MindCode-101","url":"https://github.com/Mind23-2/MindCode-101/tree/main/MVD"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92574,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"ViC-MAE (ViT-L)","metrics":{"Top-1 Accuracy":"73.7"},"paper_url":"https://arxiv.org/abs/2303.12001v3","paper_title":"ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders","paper_date":"2023-03-21","code_links":[{"title":"jeffhernandez1995/vic-mae","url":"https://github.com/jeffhernandez1995/vic-mae"},{"title":"MindCode-4/code-5","url":"https://github.com/MindCode-4/code-5/tree/main/vit_mae"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92575,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TAdaFormer-L/14","metrics":{"Top-1 Accuracy":"73.6"},"paper_url":"https://arxiv.org/abs/2308.05787v1","paper_title":"Temporally-Adaptive Models for Efficient Video Understanding","paper_date":"2023-08-10","code_links":[{"title":"alibaba-mmai-research/TAdaConv","url":"https://github.com/alibaba-mmai-research/TAdaConv"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92576,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TDS-CLIP-ViT-L/14(8frames)","metrics":{"Top-1 Accuracy":"73.4","Top-5 Accuracy":"93.8"},"paper_url":"https://arxiv.org/abs/2408.10688v1","paper_title":"TDS-CLIP: Temporal Difference Side Network for Image-to-Video Transfer Learning","paper_date":"2024-08-20","code_links":[{"title":"BBYL9413/TDS-CLIP","url":"https://github.com/BBYL9413/TDS-CLIP"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92577,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MViTv2-L (IN-21K + Kinetics400 pretrain)","metrics":{"Parameters":"213.1","Top-1 Accuracy":"73.3","Top-5 Accuracy":"94.1"},"paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","paper_date":"2021-12-02","code_links":[{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"facebookresearch/detectron2","url":"https://github.com/facebookresearch/detectron2/tree/main/projects/MViTv2"},{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"open-mmlab/mmclassification","url":"https://github.com/open-mmlab/mmclassification"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"JunweiLiang/aicity_action","url":"https://github.com/JunweiLiang/aicity_action"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"},{"title":"rajatmodi62/occludedactionbenchmark","url":"https://github.com/rajatmodi62/occludedactionbenchmark"},{"title":"3dperceptionlab/visual-wetlandbirds","url":"https://github.com/3dperceptionlab/visual-wetlandbirds"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92578,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"AMD(ViT-B/16)","metrics":{"GFLOPs":"180x6","Parameters":"87","Top-1 Accuracy":"73.3","Top-5 Accuracy":"94.0"},"paper_url":"https://arxiv.org/abs/2311.03149v2","paper_title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","paper_date":"2023-11-06","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92579,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"UniFormerV2-L","metrics":{"GFLOPs":"5154","Top-1 Accuracy":"73.0","Top-5 Accuracy":"94.5"},"paper_url":"https://openreview.net/forum?id=d77RVuVg-Mf","paper_title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","paper_date":"2022-09-22","code_links":[{"title":"OpenGVLab/UniFormerV2","url":"https://github.com/OpenGVLab/UniFormerV2"},{"title":"innat/UniFormerV2","url":"https://github.com/innat/UniFormerV2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92580,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"ST-Adapter (ViT-L, CLIP)","metrics":{"GFLOPs":"8248","Top-1 Accuracy":"72.3","Top-5 Accuracy":"93.9"},"paper_url":"https://arxiv.org/abs/2206.13559v3","paper_title":"ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning","paper_date":"2022-06-27","code_links":[{"title":"linziyi96/st-adapter","url":"https://github.com/linziyi96/st-adapter"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92581,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"ZeroI2V ViT-L/14","metrics":{"Top-1 Accuracy":"72.2","Top-5 Accuracy":"93.0"},"paper_url":"https://arxiv.org/abs/2310.01324v2","paper_title":"ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video","paper_date":"2023-10-02","code_links":[{"title":"mcg-nju/zeroi2v","url":"https://github.com/mcg-nju/zeroi2v"},{"title":"leexinhao/ZeroI2V","url":"https://github.com/leexinhao/ZeroI2V"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92582,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MViT-B (IN-21K + Kinetics400 pretrain)","metrics":{"GFLOPs":"225x3","Top-1 Accuracy":"72.1"},"paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","paper_date":"2021-12-02","code_links":[{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"facebookresearch/detectron2","url":"https://github.com/facebookresearch/detectron2/tree/main/projects/MViTv2"},{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"open-mmlab/mmclassification","url":"https://github.com/open-mmlab/mmclassification"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"JunweiLiang/aicity_action","url":"https://github.com/JunweiLiang/aicity_action"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"},{"title":"rajatmodi62/occludedactionbenchmark","url":"https://github.com/rajatmodi62/occludedactionbenchmark"},{"title":"3dperceptionlab/visual-wetlandbirds","url":"https://github.com/3dperceptionlab/visual-wetlandbirds"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92583,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"CAST(ViT-B/16)","metrics":{"Top-1 Accuracy":"71.6"},"paper_url":"https://arxiv.org/abs/2311.18825v2","paper_title":"CAST: Cross-Attention in Space and Time for Video Action Recognition","paper_date":"2023-11-30","code_links":[{"title":"khu-vll/cast","url":"https://github.com/khu-vll/cast"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92584,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"StructVit-B-4-1","metrics":{"Top-1 Accuracy":"71.5"},"paper_url":"https://arxiv.org/abs/2404.03924v1","paper_title":"Learning Correlation Structures for Vision Transformers","paper_date":"2024-04-05","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92585,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"OMNIVORE (Swin-B,  IN-21K+ Kinetics400 pretrain)","metrics":{"Top-1 Accuracy":"71.4","Top-5 Accuracy":"93.5"},"paper_url":"https://arxiv.org/abs/2201.08377v2","paper_title":"Omnivore: A Single Model for Many Visual Modalities","paper_date":"2022-01-20","code_links":[{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/omnivore","url":"https://github.com/facebookresearch/omnivore"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92586,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"BEVT (IN-1K + Kinetics400 pretrain)","metrics":{"GFLOPs":"321x3","Parameters":"89","Top-1 Accuracy":"71.4","Top-5 Accuracy":"-"},"paper_url":"https://arxiv.org/abs/2112.01529v3","paper_title":"BEVT: BERT Pretraining of Video Transformers","paper_date":"2021-12-02","code_links":[{"title":"xyzforever/bevt","url":"https://github.com/xyzforever/bevt"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92587,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"UniFormer-B (IN-1K + Kinetics400 pretrain)","metrics":{"GFLOPs":"259x3","Parameters":"50.1","Top-1 Accuracy":"71.2","Top-5 Accuracy":"92.8"},"paper_url":"https://openreview.net/forum?id=nBU_u6DLvoK","paper_title":"UniFormer: Unified Transformer for Efficient Spatial-Temporal Representation Learning","paper_date":"2021-09-29","code_links":[{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"sense-x/uniformer","url":"https://github.com/sense-x/uniformer"},{"title":"lucidrains/uniformer-pytorch","url":"https://github.com/lucidrains/uniformer-pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92588,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TAdaConvNeXtV2-B","metrics":{"Top-1 Accuracy":"71.1"},"paper_url":"https://arxiv.org/abs/2308.05787v1","paper_title":"Temporally-Adaptive Models for Efficient Video Understanding","paper_date":"2023-08-10","code_links":[{"title":"alibaba-mmai-research/TAdaConv","url":"https://github.com/alibaba-mmai-research/TAdaConv"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92589,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MAR (50% mask, ViT-B, 16x4)","metrics":{"GFLOPs":"86x6","Parameters":"94","Top-1 Accuracy":"71.0","Top-5 Accuracy":"92.8"},"paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","paper_date":"2022-07-24","code_links":[{"title":"alibaba-mmai-research/masked-action-recognition","url":"https://github.com/alibaba-mmai-research/masked-action-recognition"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92590,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MVD (Kinetics400 pretrain, ViT-S, 16 frame)","metrics":{"GFLOPs":"57x6","Parameters":"22","Top-1 Accuracy":"70.9","Top-5 Accuracy":"92.8"},"paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","paper_date":"2022-12-08","code_links":[{"title":"ruiwang2021/mvd","url":"https://github.com/ruiwang2021/mvd"},{"title":"2023-MindSpore-4/Code-5","url":"https://github.com/2023-MindSpore-4/Code-5/tree/main/MVD"},{"title":"Mind23-2/MindCode-3","url":"https://github.com/Mind23-2/MindCode-3/tree/main/MVD"},{"title":"Mind23-2/MindCode-101","url":"https://github.com/Mind23-2/MindCode-101/tree/main/MVD"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92591,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"CoVeR(JFT-3B)","metrics":{"Top-1 Accuracy":"70.9","Top-5 Accuracy":"92.5"},"paper_url":"https://arxiv.org/abs/2112.07175v1","paper_title":"Co-training Transformer with Videos and Images Improves Action Recognition","paper_date":"2021-12-14","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92592,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"VideoMAE (no extra data, ViT-B, 16frame)","metrics":{"GFLOPs":"180x6","Parameters":"87","Top-1 Accuracy":"70.8","Top-5 Accuracy":"92.4"},"paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","paper_date":"2022-03-23","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"MCG-NJU/VideoMAE","url":"https://github.com/MCG-NJU/VideoMAE"},{"title":"MCG-NJU/VideoMAE-Action-Detection","url":"https://github.com/MCG-NJU/VideoMAE-Action-Detection"},{"title":"innat/VideoMAE","url":"https://github.com/innat/VideoMAE"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/5/videomae"},{"title":"MS-P3/code7","url":"https://github.com/MS-P3/code7/tree/main/videomae"},{"title":"MindSpore-scientific/code-7","url":"https://github.com/MindSpore-scientific/code-7/tree/main/VideoMAE"},{"title":"MindCode-4/code-1","url":"https://github.com/MindCode-4/code-1/tree/main/videomae"},{"title":"MindSpore-scientific/code-13","url":"https://github.com/MindSpore-scientific/code-13/tree/main/token_learner"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92593,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"AMD(ViT-S/16)","metrics":{"GFLOPs":"57x6","Parameters":"22","Top-1 Accuracy":"70.2","Top-5 Accuracy":"92.5"},"paper_url":"https://arxiv.org/abs/2311.03149v2","paper_title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","paper_date":"2023-11-06","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92594,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"ILA (ViT-L/14)","metrics":{"Top-1 Accuracy":"70.2","Top-5 Accuracy":"91.8"},"paper_url":"https://arxiv.org/abs/2304.10465v2","paper_title":"Implicit Temporal Modeling with Learnable Alignment for Video Recognition","paper_date":"2023-04-20","code_links":[{"title":"francis-rings/ila","url":"https://github.com/francis-rings/ila"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92595,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MorphMLP-B (IN-1K)","metrics":{"GFLOPs":"197x3","Parameters":"68.5","Top-1 Accuracy":"70.1","Top-5 Accuracy":"92.8"},"paper_url":"https://arxiv.org/abs/2111.12527v3","paper_title":"MorphMLP: An Efficient MLP-Like Backbone for Spatial-Temporal Representation Learning","paper_date":"2021-11-24","code_links":[{"title":"liuruiyang98/Jittor-MLP","url":"https://github.com/liuruiyang98/Jittor-MLP"},{"title":"MTLab/MorphMLP","url":"https://github.com/MTLab/MorphMLP"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92596,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"CoVeR(JFT-300M)","metrics":{"Top-1 Accuracy":"69.8","Top-5 Accuracy":"91.9"},"paper_url":"https://arxiv.org/abs/2112.07175v1","paper_title":"Co-training Transformer with Videos and Images Improves Action Recognition","paper_date":"2021-12-14","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92597,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TPS","metrics":{"Top-1 Accuracy":"69.8"},"paper_url":"https://arxiv.org/abs/2207.13259v1","paper_title":"Spatiotemporal Self-attention Modeling with Temporal Patch Shift for Action Recognition","paper_date":"2022-07-27","code_links":[{"title":"martinxm/tps","url":"https://github.com/martinxm/tps"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92598,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"SIFA","metrics":{"Top-1 Accuracy":"69.8"},"paper_url":"https://arxiv.org/abs/2206.06931v1","paper_title":"Stand-Alone Inter-Frame Attention in Video Models","paper_date":"2022-06-14","code_links":[{"title":"fuchenustc/sifa","url":"https://github.com/fuchenustc/sifa"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92599,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"Swin-B (IN-21K + Kinetics400 pretrain)","metrics":{"GFLOPs":"321x3","Parameters":"89","Top-1 Accuracy":"69.6","Top-5 Accuracy":"92.7"},"paper_url":"https://arxiv.org/abs/2106.13230v1","paper_title":"Video Swin Transformer","paper_date":"2021-06-24","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/en/model_zoo/recognition/videoswin.md"},{"title":"SwinTransformer/Video-Swin-Transformer","url":"https://github.com/SwinTransformer/Video-Swin-Transformer"},{"title":"haofanwang/video-swin-transformer-pytorch","url":"https://github.com/haofanwang/video-swin-transformer-pytorch"},{"title":"wangjk666/stts","url":"https://github.com/wangjk666/stts"},{"title":"innat/VideoSwin","url":"https://github.com/innat/VideoSwin"},{"title":"MohammadRezaQaderi/Video-Swin-Transformer","url":"https://github.com/MohammadRezaQaderi/Video-Swin-Transformer"},{"title":"Whiffe/mmaction2_YF","url":"https://github.com/Whiffe/mmaction2_YF"},{"title":"3dperceptionlab/visual-wetlandbirds","url":"https://github.com/3dperceptionlab/visual-wetlandbirds"},{"title":"ytw1996/swin3d_mindspore","url":"https://github.com/ytw1996/swin3d_mindspore"},{"title":"w-sugar/Video-Swin-Transformer","url":"https://github.com/w-sugar/Video-Swin-Transformer"},{"title":"visaVita/mmaction2","url":"https://github.com/visaVita/mmaction2"},{"title":"acewjh/Video-Swin-Transformer","url":"https://github.com/acewjh/Video-Swin-Transformer"},{"title":"EquipoVandV/mmactionVandV","url":"https://github.com/EquipoVandV/mmactionVandV"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92600,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TDN ResNet101 (one clip, three crop, 8+16 ensemble, ImageNet pretrained, RGB only)","metrics":{"GFLOPs":"198x3","Top-1 Accuracy":"69.6","Top-5 Accuracy":"92.2"},"paper_url":"https://arxiv.org/abs/2012.10071v2","paper_title":"TDN: Temporal Difference Networks for Efficient Action Recognition","paper_date":"2020-12-18","code_links":[{"title":"MCG-NJU/TDN","url":"https://github.com/MCG-NJU/TDN"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92601,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MAR (75% mask, ViT-B, 16x4)","metrics":{"GFLOPs":"41x6","Parameters":"94","Top-1 Accuracy":"69.5","Top-5 Accuracy":"91.9"},"paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","paper_date":"2022-07-24","code_links":[{"title":"alibaba-mmai-research/masked-action-recognition","url":"https://github.com/alibaba-mmai-research/masked-action-recognition"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92602,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"ORViT Mformer-L (ORViT blocks)","metrics":{"GFLOPs":"N/A","Parameters":"N/A","Top-1 Accuracy":"69.5","Top-5 Accuracy":"91.5"},"paper_url":"https://arxiv.org/abs/2110.06915v3","paper_title":"Object-Region Video Transformers","paper_date":"2021-10-13","code_links":[{"title":"eladb3/orvit","url":"https://github.com/eladb3/orvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92603,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"UniFormer-S (IN-1K + Kinetics600 pretrain)","metrics":{"GFLOPs":"41.8x3","Parameters":"21.4","Top-1 Accuracy":"69.4","Top-5 Accuracy":"92.1"},"paper_url":"https://openreview.net/forum?id=nBU_u6DLvoK","paper_title":"UniFormer: Unified Transformer for Efficient Spatial-Temporal Representation Learning","paper_date":"2021-09-29","code_links":[{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"sense-x/uniformer","url":"https://github.com/sense-x/uniformer"},{"title":"lucidrains/uniformer-pytorch","url":"https://github.com/lucidrains/uniformer-pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92604,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MML (ensemble)","metrics":{"Top-1 Accuracy":"69.02","Top-5 Accuracy":"92.70"},"paper_url":"https://arxiv.org/abs/2011.02543v1","paper_title":"Mutual Modality Learning for Video Action Classification","paper_date":"2020-11-04","code_links":[{"title":"papermsucode/mutual-modality-learning","url":"https://github.com/papermsucode/mutual-modality-learning"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92605,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MViT-B-24, 32x3","metrics":{"GFLOPs":"236x3","Parameters":"53.2M","Top-1 Accuracy":"68.7","Top-5 Accuracy":"91.5"},"paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","paper_date":"2021-04-22","code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"facebookresearch/pytorchvideo","url":"https://github.com/facebookresearch/pytorchvideo"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/hiera","url":"https://github.com/facebookresearch/hiera"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"wangjk666/stts","url":"https://github.com/wangjk666/stts"},{"title":"junweiliang/multitrain","url":"https://github.com/junweiliang/multitrain"},{"title":"rohanshad/cmr_transformer","url":"https://github.com/rohanshad/cmr_transformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92606,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MTV-B","metrics":{"Top-1 Accuracy":"68.5","Top-5 Accuracy":"90.4"},"paper_url":"https://arxiv.org/abs/2201.04288v4","paper_title":"Multiview Transformers for Video Recognition","paper_date":"2022-01-12","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92607,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MLP-3D","metrics":{"Top-1 Accuracy":"68.5"},"paper_url":"https://arxiv.org/abs/2206.06292v1","paper_title":"MLP-3D: A MLP-like 3D Architecture with Grouped Time Mixing","paper_date":"2022-06-13","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92608,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TDN ResNet101 (one clip, center crop, 8+16 ensemble, ImageNet pretrained, RGB only)","metrics":{"GFLOPs":"198x1","Top-1 Accuracy":"68.2","Top-5 Accuracy":"91.6"},"paper_url":"https://arxiv.org/abs/2012.10071v2","paper_title":"TDN: Temporal Difference Networks for Efficient Action Recognition","paper_date":"2020-12-18","code_links":[{"title":"MCG-NJU/TDN","url":"https://github.com/MCG-NJU/TDN"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92609,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MSMA (8+16frames)","metrics":{"Top-1 Accuracy":"68.2"},"paper_url":"https://link.springer.com/chapter/10.1007/978-3-031-25075-0_40","paper_title":"Multi-scale Motion-Aware Module for Video Action Recognition","paper_date":"2023-02-19","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92610,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"Mformer-L","metrics":{"GFLOPs":"1181x3","Parameters":"N/A","Top-1 Accuracy":"68.1","Top-5 Accuracy":"91.2"},"paper_url":"https://arxiv.org/abs/2106.05392v2","paper_title":"Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers","paper_date":"2021-06-09","code_links":[{"title":"facebookresearch/xformers","url":"https://github.com/facebookresearch/xformers"},{"title":"facebookresearch/Motionformer","url":"https://github.com/facebookresearch/Motionformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92611,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"VIMPAC","metrics":{"Top-1 Accuracy":"68.1"},"paper_url":"https://arxiv.org/abs/2106.11250v1","paper_title":"VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning","paper_date":"2021-06-21","code_links":[{"title":"airsplay/vimpac","url":"https://github.com/airsplay/vimpac"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92612,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"ORViT Mformer (ORViT blocks)","metrics":{"GFLOPs":"N/A","Parameters":"N/A","Top-1 Accuracy":"67.9","Top-5 Accuracy":"90.5"},"paper_url":"https://arxiv.org/abs/2110.06915v3","paper_title":"Object-Region Video Transformers","paper_date":"2021-10-13","code_links":[{"title":"eladb3/orvit","url":"https://github.com/eladb3/orvit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92613,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MViT-B, 32x3(Kinetics600 pretrain)","metrics":{"GFLOPs":"170x3","Parameters":"36.6","Top-1 Accuracy":"67.8","Top-5 Accuracy":"91.3"},"paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","paper_date":"2021-04-22","code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"facebookresearch/pytorchvideo","url":"https://github.com/facebookresearch/pytorchvideo"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/hiera","url":"https://github.com/facebookresearch/hiera"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"wangjk666/stts","url":"https://github.com/wangjk666/stts"},{"title":"junweiliang/multitrain","url":"https://github.com/junweiliang/multitrain"},{"title":"rohanshad/cmr_transformer","url":"https://github.com/rohanshad/cmr_transformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92614,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"GC-TDN Ensemble (R50,8+16)","metrics":{"GFLOPs":"110.1","Parameters":"27.4","Top-1 Accuracy":"67.8","Top-5 Accuracy":"91.2"},"paper_url":"https://arxiv.org/abs/2203.09694v1","paper_title":"Group Contextualization for Video Recognition","paper_date":"2022-03-18","code_links":[{"title":"haoyanbin918/group-contextualization","url":"https://github.com/haoyanbin918/group-contextualization"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92615,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"CT-Net Ensemble (R50, 8+12+16+24)","metrics":{"GFLOPs":"280","Parameters":"83.8","Top-1 Accuracy":"67.8","Top-5 Accuracy":"91.1"},"paper_url":"https://arxiv.org/abs/2106.01603v1","paper_title":"CT-Net: Channel Tensorization Network for Video Classification","paper_date":"2021-06-03","code_links":[{"title":"Andy1621/CT-Net","url":"https://github.com/Andy1621/CT-Net"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92616,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TCM (Ensemble)","metrics":{"Top-1 Accuracy":"67.8"},"paper_url":"https://arxiv.org/abs/2202.12116v2","paper_title":"Motion-driven Visual Tempo Learning for Video-based Action Recognition","paper_date":"2022-02-24","code_links":[{"title":"yzfly/tcm","url":"https://github.com/yzfly/tcm"},{"title":"zphyix/tcm","url":"https://github.com/zphyix/tcm"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92617,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"SELFYNet-TSM-R50En (8+16 frames, ImageNet pretrained, 2 clips)","metrics":{"Top-1 Accuracy":"67.7","Top-5 Accuracy":"91.1"},"paper_url":"https://arxiv.org/abs/2102.07092v3","paper_title":"Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition","paper_date":"2021-02-14","code_links":[{"title":"arunos728/SELFY","url":"https://github.com/arunos728/SELFY"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92618,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"RSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips","metrics":{"Top-1 Accuracy":"67.7","Top-5 Accuracy":"91.1"},"paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","paper_date":"2021-11-02","code_links":[{"title":"KimManjin/RSA","url":"https://github.com/KimManjin/RSA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92619,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"GTDNet","metrics":{"Top-1 Accuracy":"67.6"},"paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=9961904","paper_title":"Global Temporal Difference Network for Action Recognition","paper_date":"2022-11-23","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92620,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"SELFYNet-TSM-R50En (8+16 frames, ImageNet pretrained, a single clip)","metrics":{"Top-1 Accuracy":"67.4","Top-5 Accuracy":"91"},"paper_url":"https://arxiv.org/abs/2102.07092v3","paper_title":"Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition","paper_date":"2021-02-14","code_links":[{"title":"arunos728/SELFY","url":"https://github.com/arunos728/SELFY"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92621,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"VoV3D-L (32frames, Kinetics pretrained, single)","metrics":{"GFLOPs":"20.9x6","Parameters":"5.8M","Top-1 Accuracy":"67.35","Top-5 Accuracy":"90.50"},"paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","paper_date":"2020-12-01","code_links":[{"title":"youngwanLEE/VoV3D","url":"https://github.com/youngwanLEE/VoV3D"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92622,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"PLAR","metrics":{"Top-1 Accuracy":"67.3","Top-5 Accuracy":"91"},"paper_url":"https://arxiv.org/abs/2305.12437v4","paper_title":"SCP: Soft Conditional Prompt Learning for Aerial Video Action Recognition","paper_date":"2023-05-21","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92623,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"RSANet-R50 (8+16 frames, ImageNet pretrained, a single clip)","metrics":{"Top-1 Accuracy":"67.3","Top-5 Accuracy":"90.8"},"paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","paper_date":"2021-11-02","code_links":[{"title":"KimManjin/RSA","url":"https://github.com/KimManjin/RSA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92624,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"X-Vit (x16)","metrics":{"GFLOPs":"850x1","Parameters":"N/A","Top-1 Accuracy":"67.2","Top-5 Accuracy":"90.8"},"paper_url":"https://arxiv.org/abs/2106.05968v2","paper_title":"Space-time Mixing Attention for Video Transformer","paper_date":"2021-06-10","code_links":[{"title":"1adrianb/video-transformers","url":"https://github.com/1adrianb/video-transformers"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92625,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TAda2D-En (ResNet-50, 8+16 frames)","metrics":{"Top-1 Accuracy":"67.2","Top-5 Accuracy":"89.8"},"paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","paper_date":"2021-10-12","code_links":[{"title":"alibaba-mmai-research/TAdaConv","url":"https://github.com/alibaba-mmai-research/TAdaConv"},{"title":"alibaba-mmai-research/pytorch-video-understanding","url":"https://github.com/alibaba-mmai-research/pytorch-video-understanding"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92626,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"Mformer-HR","metrics":{"GFLOPs":"958.8x3","Parameters":"N/A","Top-1 Accuracy":"67.1","Top-5 Accuracy":"90.6"},"paper_url":"https://arxiv.org/abs/2106.05392v2","paper_title":"Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers","paper_date":"2021-06-09","code_links":[{"title":"facebookresearch/xformers","url":"https://github.com/facebookresearch/xformers"},{"title":"facebookresearch/Motionformer","url":"https://github.com/facebookresearch/Motionformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92627,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TAdaConvNeXt-T","metrics":{"Top-1 Accuracy":"67.1","Top-5 Accuracy":"90.4"},"paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","paper_date":"2021-10-12","code_links":[{"title":"alibaba-mmai-research/TAdaConv","url":"https://github.com/alibaba-mmai-research/TAdaConv"},{"title":"alibaba-mmai-research/pytorch-video-understanding","url":"https://github.com/alibaba-mmai-research/pytorch-video-understanding"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92628,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MoDS (8+16frames)","metrics":{"Top-1 Accuracy":"67.1"},"paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?arnumber=9831068","paper_title":"Action Recognition With Motion Diversification and Dynamic Selection","paper_date":"2022-07-15","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92629,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"STPG (8+16frames)","metrics":{"Top-1 Accuracy":"67.0"},"paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=9852978","paper_title":"Spatial-Temporal Pyramid Graph Reasoning for Action Recognition","paper_date":"2022-08-09","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92630,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MML (single)","metrics":{"Top-1 Accuracy":"66.83","Top-5 Accuracy":"91.30"},"paper_url":"https://arxiv.org/abs/2011.02543v1","paper_title":"Mutual Modality Learning for Video Action Classification","paper_date":"2020-11-04","code_links":[{"title":"papermsucode/mutual-modality-learning","url":"https://github.com/papermsucode/mutual-modality-learning"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92631,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"ILA (ViT-B/16)","metrics":{"Top-1 Accuracy":"66.8","Top-5 Accuracy":"90.3"},"paper_url":"https://arxiv.org/abs/2304.10465v2","paper_title":"Implicit Temporal Modeling with Learnable Alignment for Video Recognition","paper_date":"2023-04-20","code_links":[{"title":"francis-rings/ila","url":"https://github.com/francis-rings/ila"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92632,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TSM (RGB + Flow)","metrics":{"Top-1 Accuracy":"66.6","Top-5 Accuracy":"91.3"},"paper_url":"https://arxiv.org/abs/1811.08383v3","paper_title":"TSM: Temporal Shift Module for Efficient Video Understanding","paper_date":"2018-11-20","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee/tree/main/towhee/models/tsm"},{"title":"MIT-HAN-LAB/temporal-shift-module","url":"https://github.com/MIT-HAN-LAB/temporal-shift-module"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/recognition/pp-tsm.md"},{"title":"mindspore-ai/models","url":"https://github.com/mindspore-ai/models/tree/master/research/cv/tsm"},{"title":"bespontaneous/ffn","url":"https://github.com/bespontaneous/ffn"},{"title":"bespontaneous/mca-pytorch","url":"https://github.com/bespontaneous/mca-pytorch"},{"title":"PaParaZz1/TemporalShiftModule","url":"https://github.com/PaParaZz1/TemporalShiftModule"},{"title":"WavesUR/embedded_TSM","url":"https://github.com/WavesUR/embedded_TSM"},{"title":"sunutf/TSM","url":"https://github.com/sunutf/TSM"},{"title":"niveditarahurkar/CS231N-ActionRecognition","url":"https://github.com/niveditarahurkar/CS231N-ActionRecognition"},{"title":"stevedepp/yolo4asl","url":"https://github.com/stevedepp/yolo4asl"},{"title":"rijuldhir/TSM","url":"https://github.com/rijuldhir/TSM"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92633,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MSNet-R50En (8+16 ensemble, ImageNet pretrained)","metrics":{"Top-1 Accuracy":"66.6","Top-5 Accuracy":"90.6"},"paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","paper_date":"2020-07-20","code_links":[{"title":"arunos728/MotionSqueeze","url":"https://github.com/arunos728/MotionSqueeze"},{"title":"arunos728/arunos728.github.io","url":"https://github.com/arunos728/arunos728.github.io"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92634,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"PAN ResNet101 (RGB only, no Flow)","metrics":{"Top-1 Accuracy":"66.5","Top-5 Accuracy":"90.6"},"paper_url":"https://arxiv.org/abs/2008.03462v1","paper_title":"PAN: Towards Fast Action Recognition via Learning Persistence of Appearance","paper_date":"2020-08-08","code_links":[{"title":"zhang-can/PAN-PyTorch","url":"https://github.com/zhang-can/PAN-PyTorch"},{"title":"tianyuan168326/EAN-Pytorch","url":"https://github.com/tianyuan168326/EAN-Pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92635,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TSM+W3 (16 frames, RGB ResNet-50)","metrics":{"Top-1 Accuracy":"66.5","Top-5 Accuracy":"90.4"},"paper_url":"https://arxiv.org/abs/2004.01278v1","paper_title":"Knowing What, Where and When to Look: Efficient Video Action Modeling with Attention","paper_date":"2020-04-02","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92636,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"Mformer","metrics":{"Top-1 Accuracy":"66.5","Top-5 Accuracy":"90.1"},"paper_url":"https://arxiv.org/abs/2106.05392v2","paper_title":"Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers","paper_date":"2021-06-09","code_links":[{"title":"facebookresearch/xformers","url":"https://github.com/facebookresearch/xformers"},{"title":"facebookresearch/Motionformer","url":"https://github.com/facebookresearch/Motionformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92637,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MVFNet-ResNet50 (center crop, 8+16 ensemble, ImageNet pretrained, RGB only)","metrics":{"Top-1 Accuracy":"66.3"},"paper_url":"https://arxiv.org/abs/2012.06977v2","paper_title":"MVFNet: Multi-View Fusion Network for Efficient Video Recognition","paper_date":"2020-12-13","code_links":[{"title":"whwu95/MVFNet","url":"https://github.com/whwu95/MVFNet"},{"title":"whwu95/DSANet","url":"https://github.com/whwu95/DSANet"},{"title":"txyugood/PaddleMVF","url":"https://github.com/txyugood/PaddleMVF"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92638,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MViT-B, 16x4","metrics":{"Top-1 Accuracy":"66.2","Top-5 Accuracy":"90.2"},"paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","paper_date":"2021-04-22","code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"facebookresearch/pytorchvideo","url":"https://github.com/facebookresearch/pytorchvideo"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/hiera","url":"https://github.com/facebookresearch/hiera"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"wangjk666/stts","url":"https://github.com/wangjk666/stts"},{"title":"junweiliang/multitrain","url":"https://github.com/junweiliang/multitrain"},{"title":"rohanshad/cmr_transformer","url":"https://github.com/rohanshad/cmr_transformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92639,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"RSANet-R50 (16 frames, ImageNet pretrained, a single clip)","metrics":{"Top-1 Accuracy":"66","Top-5 Accuracy":"89.8"},"paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","paper_date":"2021-11-02","code_links":[{"title":"KimManjin/RSA","url":"https://github.com/KimManjin/RSA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92640,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"VoV3D-L (32frames, from scratch, single)","metrics":{"GFLOPs":"20.9x6","Parameters":"5.8M","Top-1 Accuracy":"65.8","Top-5 Accuracy":"89.5"},"paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","paper_date":"2020-12-01","code_links":[{"title":"youngwanLEE/VoV3D","url":"https://github.com/youngwanLEE/VoV3D"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92641,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"E3D-L","metrics":{"GFLOPs":"18.3","Top-1 Accuracy":"65.7","Top-5 Accuracy":"89.8"},"paper_url":"https://arxiv.org/abs/2303.02693v1","paper_title":"Maximizing Spatio-Temporal Entropy of Deep 3D CNNs for Efficient Video Recognition","paper_date":"2023-03-05","code_links":[{"title":"alibaba/lightweight-neural-architecture-search","url":"https://github.com/alibaba/lightweight-neural-architecture-search"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92642,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"SELFYNet-TSM-R50 (16 frames, ImageNet pretrained)","metrics":{"Top-1 Accuracy":"65.7","Top-5 Accuracy":"89.8"},"paper_url":"https://arxiv.org/abs/2102.07092v3","paper_title":"Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition","paper_date":"2021-02-14","code_links":[{"title":"arunos728/SELFY","url":"https://github.com/arunos728/SELFY"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92643,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TAda2D (ResNet-50, 16 frames)","metrics":{"Top-1 Accuracy":"65.6","Top-5 Accuracy":"89.2"},"paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","paper_date":"2021-10-12","code_links":[{"title":"alibaba-mmai-research/TAdaConv","url":"https://github.com/alibaba-mmai-research/TAdaConv"},{"title":"alibaba-mmai-research/pytorch-video-understanding","url":"https://github.com/alibaba-mmai-research/pytorch-video-understanding"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92644,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"ViViT-L/16x2 Fact. encoder","metrics":{"Top-1 Accuracy":"65.4","Top-5 Accuracy":"89.8"},"paper_url":"https://arxiv.org/abs/2103.15691v2","paper_title":"ViViT: A Video Vision Transformer","paper_date":"2021-03-29","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"},{"title":"keras-team/keras-io","url":"https://github.com/keras-team/keras-io/blob/master/examples/vision/vivit.py"},{"title":"rishikksh20/ViViT-pytorch","url":"https://github.com/rishikksh20/ViViT-pytorch"},{"title":"mx-mark/videotransformer-pytorch","url":"https://github.com/mx-mark/videotransformer-pytorch"},{"title":"SforAiDl/vformer","url":"https://github.com/SforAiDl/vformer"},{"title":"drv-agwl/ViViT-pytorch","url":"https://github.com/drv-agwl/ViViT-pytorch"},{"title":"KSonPham/ViVit-a-Pytorch-implementation","url":"https://github.com/KSonPham/ViVit-a-Pytorch-implementation"},{"title":"Abdulrahman-Adel/Real-Life-Violence-Detection","url":"https://github.com/Abdulrahman-Adel/Real-Life-Violence-Detection"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/vivit"},{"title":"MS-P3/code7","url":"https://github.com/MS-P3/code7/tree/main/vivit"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92645,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"VoV3D-M (32frames, Kinetics pretrained, single)","metrics":{"GFLOPs":"11.5x6","Parameters":"3.3M","Top-1 Accuracy":"65.24","Top-5 Accuracy":"89.48"},"paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","paper_date":"2020-12-01","code_links":[{"title":"youngwanLEE/VoV3D","url":"https://github.com/youngwanLEE/VoV3D"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92646,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"bLVNet","metrics":{"Top-1 Accuracy":"65.2"},"paper_url":"https://arxiv.org/abs/1912.00869v1","paper_title":"More Is Less: Learning Efficient Video Representations by Big-Little Network and Depthwise Temporal Aggregation","paper_date":"2019-12-02","code_links":[{"title":"IBM/bLVNet-TAM","url":"https://github.com/IBM/bLVNet-TAM"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92647,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"DirecFormer","metrics":{"Top-1 Accuracy":"64.94","Top-5 Accuracy":"87.9"},"paper_url":"https://arxiv.org/abs/2203.10233v1","paper_title":"DirecFormer: A Directed Attention in Transformer Approach to Robust Action Recognition","paper_date":"2022-03-19","code_links":[{"title":"uark-cviu/direcformer","url":"https://github.com/uark-cviu/direcformer"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92648,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"RSANet-R50 (8 frames, ImageNet pretrained, a single clip)","metrics":{"Top-1 Accuracy":"64.8","Top-5 Accuracy":"89.1"},"paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","paper_date":"2021-11-02","code_links":[{"title":"KimManjin/RSA","url":"https://github.com/KimManjin/RSA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92649,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MSNet-R50 (16 frames, ImageNet pretrained)","metrics":{"Top-1 Accuracy":"64.7","Top-5 Accuracy":"89.4"},"paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","paper_date":"2020-07-20","code_links":[{"title":"arunos728/MotionSqueeze","url":"https://github.com/arunos728/MotionSqueeze"},{"title":"arunos728/arunos728.github.io","url":"https://github.com/arunos728/arunos728.github.io"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92650,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"AK-Net","metrics":{"Top-1 Accuracy":"64.3"},"paper_url":"https://arxiv.org/abs/2201.06304v1","paper_title":"Action Keypoint Network for Efficient Video Recognition","paper_date":"2022-01-17","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92651,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"VoV3D-M (32frames, from scratch, single)","metrics":{"GFLOPs":"11.5x6","Parameters":"3.3M","Top-1 Accuracy":"64.2","Top-5 Accuracy":"88.8"},"paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","paper_date":"2020-12-01","code_links":[{"title":"youngwanLEE/VoV3D","url":"https://github.com/youngwanLEE/VoV3D"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92652,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"VoV3D-L (16frames, from scratch, single)","metrics":{"GFLOPs":"9.3x6","Parameters":"5.8M","Top-1 Accuracy":"64.1","Top-5 Accuracy":"88.6"},"paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","paper_date":"2020-12-01","code_links":[{"title":"youngwanLEE/VoV3D","url":"https://github.com/youngwanLEE/VoV3D"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92653,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TAda2D (ResNet-50, 8 frames)","metrics":{"Top-1 Accuracy":"64.0","Top-5 Accuracy":"88.0"},"paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","paper_date":"2021-10-12","code_links":[{"title":"alibaba-mmai-research/TAdaConv","url":"https://github.com/alibaba-mmai-research/TAdaConv"},{"title":"alibaba-mmai-research/pytorch-video-understanding","url":"https://github.com/alibaba-mmai-research/pytorch-video-understanding"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92654,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MoViNet-A2","metrics":{"GFLOPs":"10.3x1","Parameters":"4.8M","Top-1 Accuracy":"63.5","Top-5 Accuracy":"89.0"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92655,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"VoV3D-M (16frames, from scratch, single)","metrics":{"GFLOPs":"5.7x6","Parameters":"3.3M","Top-1 Accuracy":"63.2","Top-5 Accuracy":"88.2"},"paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","paper_date":"2020-12-01","code_links":[{"title":"youngwanLEE/VoV3D","url":"https://github.com/youngwanLEE/VoV3D"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92656,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MSNet-R50 (8 frames, ImageNet pretrained)","metrics":{"Top-1 Accuracy":"63","Top-5 Accuracy":"88.4"},"paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","paper_date":"2020-07-20","code_links":[{"title":"arunos728/MotionSqueeze","url":"https://github.com/arunos728/MotionSqueeze"},{"title":"arunos728/arunos728.github.io","url":"https://github.com/arunos728/arunos728.github.io"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92657,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MoViNet-A1","metrics":{"GFLOPs":"6.0x1","Parameters":"4.6M","Top-1 Accuracy":"62.7","Top-5 Accuracy":"89.0"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92658,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"OmniVL","metrics":{"Top-1 Accuracy":"62.5","Top-5 Accuracy":"86.2"},"paper_url":"https://arxiv.org/abs/2209.07526v2","paper_title":"OmniVL:One Foundation Model for Image-Language and Video-Language Tasks","paper_date":"2022-09-15","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92659,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TimeSformer-HR","metrics":{"Top-1 Accuracy":"62.5"},"paper_url":"https://arxiv.org/abs/2102.05095v4","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","paper_date":"2021-02-09","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/TimeSformer","url":"https://github.com/facebookresearch/TimeSformer"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/recognition/timesformer.md"},{"title":"The-AI-Summer/self-attention-cv","url":"https://github.com/The-AI-Summer/self-attention-cv"},{"title":"lucidrains/TimeSformer-pytorch","url":"https://github.com/lucidrains/TimeSformer-pytorch"},{"title":"mx-mark/videotransformer-pytorch","url":"https://github.com/mx-mark/videotransformer-pytorch"},{"title":"jerrywn121/TianChi_AIEarth","url":"https://github.com/jerrywn121/TianChi_AIEarth"},{"title":"davide-coccomini/TimeSformer-Video-Classification","url":"https://github.com/davide-coccomini/TimeSformer-Video-Classification"},{"title":"yiyixuxu/TimeSformer-rolled-attention","url":"https://github.com/yiyixuxu/TimeSformer-rolled-attention"},{"title":"m-bain/video-transformers","url":"https://github.com/m-bain/video-transformers"},{"title":"md-mohaiminul/objectstatechange","url":"https://github.com/md-mohaiminul/objectstatechange"},{"title":"MindCode-4/code-5","url":"https://github.com/MindCode-4/code-5/tree/main/timesformer"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/timesformer"},{"title":"pwc-1/Paper-10","url":"https://github.com/pwc-1/Paper-10/tree/main/timesformer"},{"title":"halixness/generative_timesformer_pytorch","url":"https://github.com/halixness/generative_timesformer_pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92660,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TimeSformer-L","metrics":{"Top-1 Accuracy":"62.3"},"paper_url":"https://arxiv.org/abs/2102.05095v4","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","paper_date":"2021-02-09","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/TimeSformer","url":"https://github.com/facebookresearch/TimeSformer"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/recognition/timesformer.md"},{"title":"The-AI-Summer/self-attention-cv","url":"https://github.com/The-AI-Summer/self-attention-cv"},{"title":"lucidrains/TimeSformer-pytorch","url":"https://github.com/lucidrains/TimeSformer-pytorch"},{"title":"mx-mark/videotransformer-pytorch","url":"https://github.com/mx-mark/videotransformer-pytorch"},{"title":"jerrywn121/TianChi_AIEarth","url":"https://github.com/jerrywn121/TianChi_AIEarth"},{"title":"davide-coccomini/TimeSformer-Video-Classification","url":"https://github.com/davide-coccomini/TimeSformer-Video-Classification"},{"title":"yiyixuxu/TimeSformer-rolled-attention","url":"https://github.com/yiyixuxu/TimeSformer-rolled-attention"},{"title":"m-bain/video-transformers","url":"https://github.com/m-bain/video-transformers"},{"title":"md-mohaiminul/objectstatechange","url":"https://github.com/md-mohaiminul/objectstatechange"},{"title":"MindCode-4/code-5","url":"https://github.com/MindCode-4/code-5/tree/main/timesformer"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/timesformer"},{"title":"pwc-1/Paper-10","url":"https://github.com/pwc-1/Paper-10/tree/main/timesformer"},{"title":"halixness/generative_timesformer_pytorch","url":"https://github.com/halixness/generative_timesformer_pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92661,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TRG (ResNet-50)","metrics":{"Top-1 Accuracy":"62.2","Top-5 Accuracy":"90.3"},"paper_url":"https://arxiv.org/abs/1908.09995v1","paper_title":"Temporal Reasoning Graph for Activity Recognition","paper_date":"2019-08-27","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92662,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TPN (TSM-50)","metrics":{"Top-1 Accuracy":"62.0"},"paper_url":"https://arxiv.org/abs/2004.03548v2","paper_title":"Temporal Pyramid Network for Action Recognition","paper_date":"2020-04-07","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"decisionforce/TPN","url":"https://github.com/decisionforce/TPN"},{"title":"Zengxianxian727/TPN_paddle","url":"https://github.com/Zengxianxian727/TPN_paddle"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92663,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"Multigrid","metrics":{"Top-1 Accuracy":"61.7"},"paper_url":"https://arxiv.org/abs/1912.00998v2","paper_title":"A Multigrid Method for Efficiently Training Video Models","paper_date":"2019-12-02","code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"kkahatapitiya/X3D-Multigrid","url":"https://github.com/kkahatapitiya/X3D-Multigrid"},{"title":"alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates","url":"https://github.com/alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92664,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"SlowFast","metrics":{"Top-1 Accuracy":"61.7"},"paper_url":"https://arxiv.org/abs/1812.03982v3","paper_title":"SlowFast Networks for Video Recognition","paper_date":"2018-12-10","code_links":[{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"facebookresearch/pytorchvideo","url":"https://github.com/facebookresearch/pytorchvideo"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/recognition/slowfast.md"},{"title":"wangxiang1230/SSTAP","url":"https://github.com/wangxiang1230/SSTAP"},{"title":"tianfr/mononerf","url":"https://github.com/tianfr/mononerf"},{"title":"LukasHedegaard/co3d","url":"https://github.com/LukasHedegaard/co3d"},{"title":"tonysy/PyAction","url":"https://github.com/tonysy/PyAction"},{"title":"tianfr/semantic-flow","url":"https://github.com/tianfr/semantic-flow"},{"title":"jihun-kr/SlowFast","url":"https://github.com/jihun-kr/SlowFast"},{"title":"youngjun0627/movie-rating","url":"https://github.com/youngjun0627/movie-rating"},{"title":"chaitanyadwivedii/3D-Attention-is-All-You-Need","url":"https://github.com/chaitanyadwivedii/3D-Attention-is-All-You-Need"},{"title":"Mind23-2/MindCode-88","url":"https://github.com/Mind23-2/MindCode-88/tree/main/slowfast"},{"title":"Ysp9714/SlowFastNet-keras","url":"https://github.com/Ysp9714/SlowFastNet-keras"},{"title":"2023-MindSpore-4/Code7","url":"https://github.com/2023-MindSpore-4/Code7/tree/main/slowfast"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92665,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TRG (Inception-V3)","metrics":{"Top-1 Accuracy":"61.3","Top-5 Accuracy":"91.4"},"paper_url":"https://arxiv.org/abs/1908.09995v1","paper_title":"Temporal Reasoning Graph for Activity Recognition","paper_date":"2019-08-27","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92666,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MoViNet-A0","metrics":{"GFLOPs":"2.7x1","Parameters":"3.1M","Top-1 Accuracy":"61.3","Top-5 Accuracy":"88.2"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92667,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"CCS + two-stream + TRN","metrics":{"Top-1 Accuracy":"61.2","Top-5 Accuracy":"89.3"},"paper_url":"https://arxiv.org/abs/1908.10136v1","paper_title":"Cooperative Cross-Stream Network for Discriminative Action Representation","paper_date":"2019-08-27","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92668,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"VidTr-L","metrics":{"Top-1 Accuracy":"60.2"},"paper_url":"https://arxiv.org/abs/2104.11746v2","paper_title":"VidTr: Video Transformer Without Convolutions","paper_date":"2021-04-23","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92669,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TimeSformer","metrics":{"Top-1 Accuracy":"59.5"},"paper_url":"https://arxiv.org/abs/2102.05095v4","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","paper_date":"2021-02-09","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/TimeSformer","url":"https://github.com/facebookresearch/TimeSformer"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/recognition/timesformer.md"},{"title":"The-AI-Summer/self-attention-cv","url":"https://github.com/The-AI-Summer/self-attention-cv"},{"title":"lucidrains/TimeSformer-pytorch","url":"https://github.com/lucidrains/TimeSformer-pytorch"},{"title":"mx-mark/videotransformer-pytorch","url":"https://github.com/mx-mark/videotransformer-pytorch"},{"title":"jerrywn121/TianChi_AIEarth","url":"https://github.com/jerrywn121/TianChi_AIEarth"},{"title":"davide-coccomini/TimeSformer-Video-Classification","url":"https://github.com/davide-coccomini/TimeSformer-Video-Classification"},{"title":"yiyixuxu/TimeSformer-rolled-attention","url":"https://github.com/yiyixuxu/TimeSformer-rolled-attention"},{"title":"m-bain/video-transformers","url":"https://github.com/m-bain/video-transformers"},{"title":"md-mohaiminul/objectstatechange","url":"https://github.com/md-mohaiminul/objectstatechange"},{"title":"MindCode-4/code-5","url":"https://github.com/MindCode-4/code-5/tree/main/timesformer"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/timesformer"},{"title":"pwc-1/Paper-10","url":"https://github.com/pwc-1/Paper-10/tree/main/timesformer"},{"title":"halixness/generative_timesformer_pytorch","url":"https://github.com/halixness/generative_timesformer_pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92670,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"SVT","metrics":{"Top-1 Accuracy":"59.2"},"paper_url":"https://arxiv.org/abs/2112.01514v2","paper_title":"Self-supervised Video Transformer","paper_date":"2021-12-02","code_links":[{"title":"kahnchana/svt","url":"https://github.com/kahnchana/svt"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92671,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"TAM (5-shot)","metrics":{"Top-1 Accuracy":"52.3"},"paper_url":"https://arxiv.org/abs/1906.11415v1","paper_title":"Few-Shot Video Classification via Temporal Alignment","paper_date":"2019-06-27","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92672,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"model3D_1 with left-right augmentation and fps jitter","metrics":{"Top-1 Accuracy":"51.33","Top-5 Accuracy":"80.46"},"paper_url":"http://arxiv.org/abs/1706.04261v2","paper_title":"The \"something something\" video database for learning and evaluating visual common sense","paper_date":"2017-06-13","code_links":[{"title":"jayleicn/singularity","url":"https://github.com/jayleicn/singularity"},{"title":"bit-ml/dyreg-gnn","url":"https://github.com/bit-ml/dyreg-gnn"},{"title":"caspillaga/Conv3DSelfAttention","url":"https://github.com/caspillaga/Conv3DSelfAttention"},{"title":"akshyta/Human-Activity-Recognition","url":"https://github.com/akshyta/Human-Activity-Recognition"},{"title":"latte488/smth-smth-v2","url":"https://github.com/latte488/smth-smth-v2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92673,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"Prob-Distill","metrics":{"Top-1 Accuracy":"49.9","Top-5 Accuracy":"79.1"},"paper_url":"https://arxiv.org/abs/1904.03249v2","paper_title":"Attention Distillation for Learning Video Representations","paper_date":"2019-04-05","code_links":[],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92674,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"STM + TRNMultiscale","metrics":{"Top-1 Accuracy":"47.73"},"paper_url":"https://arxiv.org/abs/1909.05165v2","paper_title":"Comparative Analysis of CNN-based Spatiotemporal Reasoning in Videos","paper_date":"2019-09-11","code_links":[{"title":"fubel/stmodeling","url":"https://github.com/fubel/stmodeling"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92675,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"InternVideo2-6B","metrics":{"GFLOPs":"13321","Parameters":"2131","Top-1 Accuracy":"1","Top-5 Accuracy":"12"},"paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_date":"2024-03-22","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]},{"id":92676,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MViTv2-B (IN-21K + Kinetics400 pretrain)","metrics":{"Parameters":"51.1","Top-5 Accuracy":"93.4"},"paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","paper_date":"2021-12-02","code_links":[{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"facebookresearch/detectron2","url":"https://github.com/facebookresearch/detectron2/tree/main/projects/MViTv2"},{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"open-mmlab/mmclassification","url":"https://github.com/open-mmlab/mmclassification"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"JunweiLiang/aicity_action","url":"https://github.com/JunweiLiang/aicity_action"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"},{"title":"rajatmodi62/occludedactionbenchmark","url":"https://github.com/rajatmodi62/occludedactionbenchmark"},{"title":"3dperceptionlab/visual-wetlandbirds","url":"https://github.com/3dperceptionlab/visual-wetlandbirds"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92677,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"RSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips)","metrics":{"Top-5 Accuracy":"91.1"},"paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","paper_date":"2021-11-02","code_links":[{"title":"KimManjin/RSA","url":"https://github.com/KimManjin/RSA"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92678,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MoViNet-A3","metrics":{"GFLOPs":"23.7x1","Parameters":"5.3M"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":0,"source":"archive","tags":[]},{"id":92679,"task":"Action Recognition","parent_task":null,"dataset":"Something-Something V2","model_name":"MViT-L (IN-21K + Kinetics400 pretrain)","metrics":{"GFLOPs":"2828x3"},"paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","paper_date":"2021-12-02","code_links":[{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"facebookresearch/detectron2","url":"https://github.com/facebookresearch/detectron2/tree/main/projects/MViTv2"},{"title":"facebookresearch/SlowFast","url":"https://github.com/facebookresearch/SlowFast"},{"title":"open-mmlab/mmclassification","url":"https://github.com/open-mmlab/mmclassification"},{"title":"facebookresearch/mvit","url":"https://github.com/facebookresearch/mvit"},{"title":"JunweiLiang/aicity_action","url":"https://github.com/JunweiLiang/aicity_action"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"},{"title":"rajatmodi62/occludedactionbenchmark","url":"https://github.com/rajatmodi62/occludedactionbenchmark"},{"title":"3dperceptionlab/visual-wetlandbirds","url":"https://github.com/3dperceptionlab/visual-wetlandbirds"}],"metrics_order":"[\"Top-1 Accuracy\", \"Top-5 Accuracy\", \"Parameters\", \"GFLOPs\"]","area":"Time Series","uses_additional_data":1,"source":"archive","tags":[]}]}