paper
-with-
me
Papers
Browse State-of-the-Art
Datasets
Methods
AI Agents
Trends
Digest
🌙
Action Recognition In Videos
벤치마크
Action Recognition In Videos on
Kinetics-400
9개 결과 ·
⬇ CSV
·
JSON
Top-1 Accuracy
81.7
82.9
84.1
85.3
86.5
2021-09
2026-09
ActionCLIP (ViT-B/16) — 83.8 (2021-09-17)
ActionCLIP (ViT-B/16) — 83.8 (2021-09-17)
ActionCLIP (ViT-B/16) — 83.8 (2021-09-17)
Florence — 86.5 (2021-11-22)
Florence — 86.5 (2021-11-22)
Florence — 86.5 (2021-11-22)
Frozen Backbone, SwinV2-G-ext22K (Video-Swin) — 81.7 (2022-11-03)
Frozen Backbone, SwinV2-G-ext22K (Video-Swin) — 81.7 (2022-11-03)
Frozen Backbone, SwinV2-G-ext22K (Video-Swin) — 81.7 (2022-11-03)
ActionCLIP (ViT-B/16) — 83.8 (2021-09-17)
Florence — 86.5 (2021-11-22)
2021-09-17 — ActionCLIP (ViT-B/16): Top-1 Accuracy 83.8
2021-11-22 — Florence: Top-1 Accuracy 86.5
Rank
Model
Top-1 Accuracy
Top-5 Accuracy
Paper
Code
Year
1
Florence
86.5
97.3
Florence: A New Foundation Model for Computer Vision
microsoft/unicl
·
MindCode-4/code-3
2021
2
ActionCLIP (ViT-B/16)
83.8
–
ActionCLIP: A New Paradigm for Video Action Recognition
towhee-io/towhee
·
sallymmx/actionclip
2021
3
Frozen Backbone, SwinV2-G-ext22K (Video-Swin)
81.7
–
Could Giant Pretrained Image Models Extract Universal Representations?
2022
4
Florence
86.5
97.3
Florence: A New Foundation Model for Computer Vision
microsoft/unicl
·
MindCode-4/code-3
2021
5
ActionCLIP (ViT-B/16)
83.8
–
ActionCLIP: A New Paradigm for Video Action Recognition
towhee-io/towhee
·
sallymmx/actionclip
2021
6
Frozen Backbone, SwinV2-G-ext22K (Video-Swin)
81.7
–
Could Giant Pretrained Image Models Extract Universal Representations?
2022
7
Florence
86.5
97.3
Florence: A New Foundation Model for Computer Vision
microsoft/unicl
·
MindCode-4/code-3
2021
8
ActionCLIP (ViT-B/16)
83.8
–
ActionCLIP: A New Paradigm for Video Action Recognition
towhee-io/towhee
·
sallymmx/actionclip
2021
9
Frozen Backbone, SwinV2-G-ext22K (Video-Swin)
81.7
–
Could Giant Pretrained Image Models Extract Universal Representations?
2022
1–9 / 9
페이지당
10
20
50
100