{"task":"Action Classification","dataset":"MiT","metric_names":["Top 1 Accuracy","Top 5 Accuracy"],"rows":[{"id":17474,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"OmniVec2","metrics":{"Top 1 Accuracy":"53.1"},"paper_url":"http://openaccess.thecvf.com//content/CVPR2024/html/Srivastava_OmniVec2_-_A_Novel_Transformer_based_Network_for_Large_Scale_CVPR_2024_paper.html","paper_title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","paper_date":"2024-01-01","code_links":[],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17475,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"InternVideo2-1B","metrics":{"Top 1 Accuracy":"50.9"},"paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_date":"2024-03-22","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17476,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"UMT-L (ViT-L/16)","metrics":{"Top 1 Accuracy":"48.7","Top 5 Accuracy":"78.2"},"paper_url":"https://arxiv.org/abs/2303.16058v2","paper_title":"Unmasked Teacher: Towards Training-Efficient Video Foundation Models","paper_date":"2023-03-28","code_links":[{"title":"opengvlab/unmasked_teacher","url":"https://github.com/opengvlab/unmasked_teacher"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17477,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"UniFormerV2-L","metrics":{"Top 1 Accuracy":"47.8","Top 5 Accuracy":"76.9"},"paper_url":"https://openreview.net/forum?id=d77RVuVg-Mf","paper_title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","paper_date":"2022-09-22","code_links":[{"title":"OpenGVLab/UniFormerV2","url":"https://github.com/OpenGVLab/UniFormerV2"},{"title":"innat/UniFormerV2","url":"https://github.com/innat/UniFormerV2"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17478,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"MTV-H (WTS 60M)","metrics":{"Top 1 Accuracy":"47.2","Top 5 Accuracy":"75.7"},"paper_url":"https://arxiv.org/abs/2201.04288v4","paper_title":"Multiview Transformers for Video Recognition","paper_date":"2022-01-12","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17479,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"CoVeR(JFT-3B)","metrics":{"Top 1 Accuracy":"46.1","Top 5 Accuracy":"75.4"},"paper_url":"https://arxiv.org/abs/2112.07175v1","paper_title":"Co-training Transformer with Videos and Images Improves Action Recognition","paper_date":"2021-12-14","code_links":[],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17480,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"CoVeR(JFT-300M)","metrics":{"Top 1 Accuracy":"45.0","Top 5 Accuracy":"73.9"},"paper_url":"https://arxiv.org/abs/2112.07175v1","paper_title":"Co-training Transformer with Videos and Images Improves Action Recognition","paper_date":"2021-12-14","code_links":[],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17481,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"VATT-Large","metrics":{"Top 1 Accuracy":"41.1","Top 5 Accuracy":"67.7"},"paper_url":"https://arxiv.org/abs/2104.11178v3","paper_title":"VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text","paper_date":"2021-04-22","code_links":[{"title":"google-research/google-research","url":"https://github.com/google-research/google-research/tree/master/vatt"},{"title":"akashe/ProgrammingInterview","url":"https://github.com/akashe/ProgrammingInterview"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/3/vat"},{"title":"MindCode-4/code-9","url":"https://github.com/MindCode-4/code-9/tree/main/vat"},{"title":"MindCode-4/code-13","url":"https://github.com/MindCode-4/code-13/tree/main/vat"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17482,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"MoViNet-A6","metrics":{"Top 1 Accuracy":"40.2"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17483,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"MoViNet-A5","metrics":{"Top 1 Accuracy":"39.1"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17484,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"MoViNet-A4","metrics":{"Top 1 Accuracy":"37.9"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17485,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"VTN","metrics":{"Top 1 Accuracy":"37.4","Top 5 Accuracy":"65.4"},"paper_url":"https://arxiv.org/abs/2102.00719v3","paper_title":"Video Transformer Network","paper_date":"2021-02-01","code_links":[{"title":"bomri/SlowFast","url":"https://github.com/bomri/SlowFast/blob/master/projects/vtn/README.md"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17486,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"MBT (AV)","metrics":{"Top 1 Accuracy":"37.3","Top 5 Accuracy":"61.2"},"paper_url":"https://arxiv.org/abs/2107.00135v3","paper_title":"Attention Bottlenecks for Multimodal Fusion","paper_date":"2021-06-30","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/mbt"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17487,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"MoViNet-A3","metrics":{"Top 1 Accuracy":"35.6"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17488,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"MoViNet-A2","metrics":{"Top 1 Accuracy":"34.3"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17489,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"AssembleNet","metrics":{"Top 1 Accuracy":"34.27%","Top 5 Accuracy":"62.71%"},"paper_url":"https://arxiv.org/abs/1905.13209v4","paper_title":"AssembleNet: Searching for Multi-Stream Neural Connectivity in Video Architectures","paper_date":"2019-05-30","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models/tree/master/official/vision/beta/projects/assemblenet"},{"title":"google-research/google-research","url":"https://github.com/google-research/google-research/tree/master/assemblenet"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17490,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"SRTG r3d-101","metrics":{"Top 1 Accuracy":"33.56","Top 5 Accuracy":"58.49"},"paper_url":"https://arxiv.org/abs/2006.08247v2","paper_title":"Learn to cycle: Time-consistent feature discovery for action recognition","paper_date":"2020-06-15","code_links":[{"title":"alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates","url":"https://github.com/alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates/blob/master/train_model.py"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17491,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"CoST (ResNet-101, 32 frames)","metrics":{"Top 1 Accuracy":"32.4%","Top 5 Accuracy":"60.0%"},"paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Li_Collaborative_Spatiotemporal_Feature_Learning_for_Video_Action_Recognition_CVPR_2019_paper.html","paper_title":"Collaborative Spatiotemporal Feature Learning for Video Action Recognition","paper_date":"2019-06-01","code_links":[{"title":"hikvision-research/cost","url":"https://github.com/hikvision-research/cost"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17492,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"MoViNet-A1","metrics":{"Top 1 Accuracy":"32.0"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17493,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"EvaNet","metrics":{"Top 1 Accuracy":"31.8%"},"paper_url":"https://arxiv.org/abs/1811.10636v2","paper_title":"Evolving Space-Time Neural Architectures for Videos","paper_date":"2018-11-26","code_links":[],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17494,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"SRTG r(2+1)d-50","metrics":{"Top 1 Accuracy":"31.60","Top 5 Accuracy":"56.80"},"paper_url":"https://arxiv.org/abs/2006.08247v2","paper_title":"Learn to cycle: Time-consistent feature discovery for action recognition","paper_date":"2020-06-15","code_links":[{"title":"alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates","url":"https://github.com/alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates/blob/master/train_model.py"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17495,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"SRTG r3d-50","metrics":{"Top 1 Accuracy":"30.72","Top 5 Accuracy":"55.65"},"paper_url":"https://arxiv.org/abs/2006.08247v2","paper_title":"Learn to cycle: Time-consistent feature discovery for action recognition","paper_date":"2020-06-15","code_links":[{"title":"alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates","url":"https://github.com/alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates/blob/master/train_model.py"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17496,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"I3D","metrics":{"Top 1 Accuracy":"29.51%","Top 5 Accuracy":"56.06%"},"paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","paper_date":"2017-05-22","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"deepmind/kinetics-i3d","url":"https://github.com/deepmind/kinetics-i3d"},{"title":"google-deepmind/kinetics-i3d","url":"https://github.com/google-deepmind/kinetics-i3d"},{"title":"piergiaj/pytorch-i3d","url":"https://github.com/piergiaj/pytorch-i3d"},{"title":"hassony2/kinetics_i3d_pytorch","url":"https://github.com/hassony2/kinetics_i3d_pytorch"},{"title":"yaohungt/GSTEG_CVPR_2019","url":"https://github.com/yaohungt/GSTEG_CVPR_2019"},{"title":"dlpbc/keras-kinetics-i3d","url":"https://github.com/dlpbc/keras-kinetics-i3d"},{"title":"CMU-CREATE-Lab/deep-smoke-machine","url":"https://github.com/CMU-CREATE-Lab/deep-smoke-machine"},{"title":"FrederikSchorr/sign-language","url":"https://github.com/FrederikSchorr/sign-language"},{"title":"StanfordVL/RubiksNet","url":"https://github.com/StanfordVL/RubiksNet"},{"title":"JeffCHEN2017/WSSTG","url":"https://github.com/JeffCHEN2017/WSSTG"},{"title":"LukasHedegaard/co3d","url":"https://github.com/LukasHedegaard/co3d"},{"title":"OanaIgnat/i3d_keras","url":"https://github.com/OanaIgnat/i3d_keras"},{"title":"ahsaniqbal/Kinetics-FeatureExtractor","url":"https://github.com/ahsaniqbal/Kinetics-FeatureExtractor"},{"title":"ivanwilliammd/I3DR-Net-Transfer-Learning","url":"https://github.com/ivanwilliammd/I3DR-Net-Transfer-Learning"},{"title":"PPPrior/i3d-pytorch","url":"https://github.com/PPPrior/i3d-pytorch"},{"title":"aim3-ruc/youmakeup_challenge2022","url":"https://github.com/aim3-ruc/youmakeup_challenge2022"},{"title":"xiuyu0000/new_papers_codes","url":"https://github.com/xiuyu0000/new_papers_codes/tree/main/I3D"},{"title":"anonymous-p/Flickering_Adversarial_Video","url":"https://github.com/anonymous-p/Flickering_Adversarial_Video"},{"title":"prinshul/GWSDR","url":"https://github.com/prinshul/GWSDR"},{"title":"vijayvee/behavior_recognition","url":"https://github.com/vijayvee/behavior_recognition"},{"title":"vijayvee/behavior-recognition","url":"https://github.com/vijayvee/behavior-recognition"},{"title":"AbdurrahmanNadi/activity_recognition_web_service","url":"https://github.com/AbdurrahmanNadi/activity_recognition_web_service"},{"title":"ZJUT-ERCISS/zjut_mindvideo","url":"https://github.com/ZJUT-ERCISS/zjut_mindvideo/blob/master/msvideo/models/i3d.py"},{"title":"Alexyuda/action_recognition","url":"https://github.com/Alexyuda/action_recognition"},{"title":"MarkoLewis-Projects/Sign_language_detection","url":"https://github.com/MarkoLewis-Projects/Sign_language_detection"},{"title":"sebastiantiesmeyer/deeplabchop3d","url":"https://github.com/sebastiantiesmeyer/deeplabchop3d"},{"title":"xiuyu0000/vision","url":"https://github.com/xiuyu0000/vision/blob/main/mindvision/msvideo/models/i3d.py"},{"title":"KingGugu/I3D","url":"https://github.com/KingGugu/I3D"},{"title":"daniansan/i3d_mindspore","url":"https://github.com/daniansan/i3d_mindspore"},{"title":"mHealthBuet/SegCodeNet","url":"https://github.com/mHealthBuet/SegCodeNet"},{"title":"ShobhitMaheshwari/sign-language1","url":"https://github.com/ShobhitMaheshwari/sign-language1"},{"title":"2023-MindSpore-1/ms-code-24","url":"https://github.com/2023-MindSpore-1/ms-code-24"},{"title":"helloxy96/CS5242_Project2020","url":"https://github.com/helloxy96/CS5242_Project2020"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17497,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"SRTG r(2+1)d-34","metrics":{"Top 1 Accuracy":"28.97","Top 5 Accuracy":"54.18"},"paper_url":"https://arxiv.org/abs/2006.08247v2","paper_title":"Learn to cycle: Time-consistent feature discovery for action recognition","paper_date":"2020-06-15","code_links":[{"title":"alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates","url":"https://github.com/alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates/blob/master/train_model.py"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17498,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"SRTG r3d-34","metrics":{"Top 1 Accuracy":"28.55","Top 5 Accuracy":"52.35"},"paper_url":"https://arxiv.org/abs/2006.08247v2","paper_title":"Learn to cycle: Time-consistent feature discovery for action recognition","paper_date":"2020-06-15","code_links":[{"title":"alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates","url":"https://github.com/alexandrosstergiou/Squeeze-and-Recursion-Temporal-Gates/blob/master/train_model.py"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17499,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"TRN-Multiscale","metrics":{"Top 1 Accuracy":"28.27","Top 5 Accuracy":"53.87"},"paper_url":"http://arxiv.org/abs/1711.08496v2","paper_title":"Temporal Relational Reasoning in Videos","paper_date":"2017-11-22","code_links":[{"title":"metalbubble/TRN-pytorch","url":"https://github.com/metalbubble/TRN-pytorch"},{"title":"zhoubolei/TRN-pytorch","url":"https://github.com/zhoubolei/TRN-pytorch"},{"title":"okankop/MFF-pytorch","url":"https://github.com/okankop/MFF-pytorch"},{"title":"2023-MindSpore-1/ms-code-7","url":"https://github.com/2023-MindSpore-1/ms-code-7/tree/main/trn"},{"title":"MindSpore-paper-code-2/code3","url":"https://github.com/MindSpore-paper-code-2/code3/tree/main/trn"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17500,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"MoViNet-A0","metrics":{"Top 1 Accuracy":"27.5"},"paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","paper_date":"2021-03-21","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"Atze00/MoViNet-pytorch","url":"https://github.com/Atze00/MoViNet-pytorch"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17501,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"ViViT-L/16x2","metrics":{"Top 5 Accuracy":"64.9"},"paper_url":"https://arxiv.org/abs/2103.15691v2","paper_title":"ViViT: A Video Vision Transformer","paper_date":"2021-03-29","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"},{"title":"keras-team/keras-io","url":"https://github.com/keras-team/keras-io/blob/master/examples/vision/vivit.py"},{"title":"rishikksh20/ViViT-pytorch","url":"https://github.com/rishikksh20/ViViT-pytorch"},{"title":"mx-mark/videotransformer-pytorch","url":"https://github.com/mx-mark/videotransformer-pytorch"},{"title":"SforAiDl/vformer","url":"https://github.com/SforAiDl/vformer"},{"title":"drv-agwl/ViViT-pytorch","url":"https://github.com/drv-agwl/ViViT-pytorch"},{"title":"KSonPham/ViVit-a-Pytorch-implementation","url":"https://github.com/KSonPham/ViVit-a-Pytorch-implementation"},{"title":"Abdulrahman-Adel/Real-Life-Violence-Detection","url":"https://github.com/Abdulrahman-Adel/Real-Life-Violence-Detection"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/vivit"},{"title":"MS-P3/code7","url":"https://github.com/MS-P3/code7/tree/main/vivit"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17502,"task":"Action Classification","parent_task":"Video","dataset":"MiT","model_name":"TSN-2Stream","metrics":{"Top 5 Accuracy":"50.10%"},"paper_url":"http://arxiv.org/abs/1705.02953v1","paper_title":"Temporal Segment Networks for Action Recognition in Videos","paper_date":"2017-05-08","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"open-mmlab/mmaction","url":"https://github.com/open-mmlab/mmaction"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/recognition/pp-tsn.md"},{"title":"yjxiong/temporal-segment-networks","url":"https://github.com/yjxiong/temporal-segment-networks"},{"title":"yjxiong/caffe","url":"https://github.com/yjxiong/caffe"},{"title":"peachman05/action-recognition-tutorial","url":"https://github.com/peachman05/action-recognition-tutorial"},{"title":"ayushrox/TSN_Colab","url":"https://github.com/ayushrox/TSN_Colab"},{"title":"thaitruongan/camera-surveillance-ai","url":"https://github.com/thaitruongan/camera-surveillance-ai"},{"title":"2023-MindSpore-1/ms-code-7","url":"https://github.com/2023-MindSpore-1/ms-code-7/tree/main/tsn"},{"title":"MindSpore-paper-code-2/code3","url":"https://github.com/MindSpore-paper-code-2/code3/tree/main/tsn"},{"title":"mtlouie-unm/alome-tsn","url":"https://github.com/mtlouie-unm/alome-tsn"}],"metrics_order":"[\"Top 1 Accuracy\", \"Top 5 Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]}]}