paper-with-me

Video Summarization

6개 벤치마크 · 논문 309편 · 이 태스크의 논문 보기 →

Benchmarks

SumMe

결과 13개

TvSum

결과 13개

Shot2Story20K

결과 4개

Mr. HiSum

결과 2개

videoxum

결과 2개

Most implemented

Summarizing Videos with Attention

2018-12-05 · 구현 5개

Papers

MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing

2026-07-28 · Katsuya Ogata, Zongshang Pang, Mayu Otani, Yuta Nakashima arxiv

Video editing is fundamentally message-driven: even from the same source footage, the selected shots change depending on the narrative the editor wishes to convey. Benchmarks for a closely related task, video summarizati…

Video Summarization

Scribby: A Multi-Level LLM Framework for Semantic Video Analysis

2026-06-08 · Julian Abelarde, Hugo Garrido-Lestache Belinchon arxiv

As video content continues to expand across educational platforms, recorded lectures, and live-streamed entertainment, the need for efficient and structured analysis of long-form footage has increased \cite{1}. Although …

Semantic SimilarityVideo Summarization

Frames2LoRA: Parametric Video Internalization for Vision-Language Models

2026-06-03 · Manan Suri, Sarvesh Baskar, Dinesh Manocha arxiv

Processing video in vision-language models is expensive: each frame occupies hundreds of tokens, and inference cost scales with every frame and every repeated query. We introduce Frames2LoRA, a method for parametric vide…

Video Question AnsweringVideo Summarization

A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

2026-06-03 · Huangchen Xu, Yuan Wu, Yi Chang arxiv

Multimodal Large Language Models (MLLMs) are increasingly used for video understanding, yet their reliability under multi-video inputs remains poorly understood. We study positional bias in multi-video summarization, whe…

Video Summarization

Towards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration

2026-05-25 · Xiaotian Hu, Mingxuan Liu, Junwei Huang, Kasidit Anmahapong 외 arxiv

Automated fetal ultrasound interpretation requires a workflow from visual perception, including plane recognition and anatomical segmentation, to clinical understanding, including biometric measurement and diagnostic rep…

Visual Question AnsweringVideo SummarizationImage Captioning

Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models

2026-05-12 · Maham Nazir, Muhammad Aqeel, Richong Zhang, Francesco Setti arxiv

Multimodal video summarization requires visual features that align semantically with language generation. Traditional approaches rely on CNN features trained for object classification, which represent visual concepts as …

Video Summarization

전체 309편 보기 →