Dense Video Captioning on ViTT
SODA
- 2023-02-27 — Vid2Seq: SODA 0.135
- 2024-12-19 — HiCM²: SODA 0.15
| Rank | Model | SODA | CIDEr | METEOR | Extra Training Data | Paper | Code | Year |
|---|---|---|---|---|---|---|---|---|
| 1 | Vid2Seq (VidChapters-7M PT) | 0.151 | 50.9 | 9.5 | ✓ | |||
| 2 | HiCM² | 0.150 | 51.2 | 9.6 | ✓ | HiCM$^2$: Hierarchical Compact Memory Modeling for Dense Video Captioning | ailab-kyunghee/HiCM2-DVC | 2024 |
| 3 | Vid2Seq | 0.135 | 43.5 | 8.5 | ✓ | Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning | google-research/scenic · antoyang/VidChapters · KastanDay/video-pretrained-transformer | 2023 |
| 4 | E2ESG | – | 25.0 | 8.1 | ✓ | End-to-end Dense Video Captioning as Sequence Generation | 2022 | |
| 5 | Vid2Seq (VidChapters-7M PT) | 0.151 | 50.9 | 9.5 | ✓ | |||
| 6 | HiCM² | 0.150 | 51.2 | 9.6 | ✓ | HiCM$^2$: Hierarchical Compact Memory Modeling for Dense Video Captioning | ailab-kyunghee/HiCM2-DVC | 2024 |
| 7 | Vid2Seq | 0.135 | 43.5 | 8.5 | ✓ | Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning | google-research/scenic · antoyang/VidChapters · KastanDay/video-pretrained-transformer | 2023 |
| 8 | E2ESG | – | 25.0 | 8.1 | ✓ | End-to-end Dense Video Captioning as Sequence Generation | 2022 |