Dense Video Captioning
4개 벤치마크 · 논문 90편 · 이 태스크의 논문 보기 →
Benchmarks
Most implemented
Multi-modal Dense Video Captioning
Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning
SoccerNet 2023 Challenges Results
SoccerNet-Caption: Dense Video Captioning for Soccer Broadcasts Commentaries
End-to-End Dense Video Captioning with Parallel Decoding
Papers
Claim-Level Rubric Rewards for Video Caption Reinforcement Learning
In this paper, we introduce Claim-Level Rubric Rewards (CuRe), a structured reward framework designed to address the reward-design bottleneck in reinforcement learning for dense video captioning. Existing reward designs …
Dense Video CaptioningReinforcement LearningParallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning
Dense video captioning aims to generate temporally grounded descriptions of video events, benefiting both event-level video understanding and generation. In this domain, autoregressive video large language models have em…
Dense Video CaptioningCodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning
Existing video captioning methods struggle to balance visual fidelity and redundancy: holistic captions are compact but lose fine-grained evidence, whereas segment-wise captions improve coverage but introduce heavy redun…
Dense Video CaptioningDense CaptioningDenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
Long-term video understanding requires interpreting complex temporal events and reasoning over procedural activities. While instructional video corpora, like HowTo100M, offer rich resources for model training, they prese…
Zero-shot GeneralizationDense Video CaptioningCross-Modal RetrievalSAVA-X: Ego-to-Exo Imitation Error Detection via Scene-Adaptive View Alignment and Bidirectional Cross View Fusion
Error detection is crucial in industrial training, healthcare, and assembly quality control. Most existing work assumes a single-view setting and cannot handle the practical case where a third-person (exo) demonstration …
Dense Video CaptioningAction DetectionStay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning
Dense Video Captioning (DVC) is a challenging multimodal task that involves temporally localizing multiple events within a video and describing them with natural language. While query-based frameworks enable the simultan…
Dense Video Captioning