Video Summarization
6개 벤치마크 · 논문 309편 · 이 태스크의 논문 보기 →
Benchmarks
Most implemented
Deep Reinforcement Learning for Unsupervised Video Summarization with Diversity-Representativeness Reward
Summarizing Videos with Attention
GPT2MVS: Generative Pre-trained Transformer-2 for Multi-modal Video Summarization
Papers
MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing
Video editing is fundamentally message-driven: even from the same source footage, the selected shots change depending on the narrative the editor wishes to convey. Benchmarks for a closely related task, video summarizati…
Video SummarizationScribby: A Multi-Level LLM Framework for Semantic Video Analysis
As video content continues to expand across educational platforms, recorded lectures, and live-streamed entertainment, the need for efficient and structured analysis of long-form footage has increased \cite{1}. Although …
Semantic SimilarityVideo SummarizationFrames2LoRA: Parametric Video Internalization for Vision-Language Models
Processing video in vision-language models is expensive: each frame occupies hundreds of tokens, and inference cost scales with every frame and every repeated query. We introduce Frames2LoRA, a method for parametric vide…
Video Question AnsweringVideo SummarizationA Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs
Multimodal Large Language Models (MLLMs) are increasingly used for video understanding, yet their reliability under multi-video inputs remains poorly understood. We study positional bias in multi-video summarization, whe…
Video SummarizationTowards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration
Automated fetal ultrasound interpretation requires a workflow from visual perception, including plane recognition and anatomical segmentation, to clinical understanding, including biometric measurement and diagnostic rep…
Visual Question AnsweringVideo SummarizationImage CaptioningMultimodal Abstractive Summarization of Instructional Videos with Vision-Language Models
Multimodal video summarization requires visual features that align semantically with language generation. Traditional approaches rely on CNN features trained for object classification, which represent visual concepts as …
Video Summarization