paper-with-me

Papers

UniVBench: Towards Unified Evaluation for Video Foundation Models

2026-02-25 · Jianhui Wei, Xiaotian Zhang, Yichen Li, Yuan Wang, Yan Zhang, Ziyi Chen, Zhihang Tang, Wei Xu, Zuozhu Liu arxiv

Video foundation models aim to integrate video understanding, generation, editing, and instruction following within a single framework, making them a central direction for next-generation multimodal systems. However, existing evaluation benchmarks remain fragmented and limited in scope, as they each target a single task, rely on task-specific metrics, and typically use short or simple video clips. As a result, they do not capture the unified capabilities that these models are designed to deliver. To address this gap, we introduce UniVBench, a benchmark purpose-built for evaluating video foundation models across four core abilities: video understanding, video generation, video editing, and a newly proposed task, video reconstruction, which assesses how faithfully a model can reproduce video content it has encountered. Our benchmark substantially expands the complexity of evaluation by incorporating 200 high-quality, diverse and multi-shot videos, each paired with detailed captions, multi-format editing instructions, and reference images. All videos are human-created and carefully validated, offering richer cinematic information than prior benchmarks. In addition, we develop a unified agentic evaluation system (UniV-Eval) that standardizes prompting, instruction parsing, and scoring across all tasks, enabling fair, scalable, and reproducible comparisons of unified video models. By grounding evaluation in instruction-based multi-shot video tasks, UniVBench provides the first framework for measuring the integrated capabilities that video foundation models aim to achieve. Extensive human annotations ensure our evaluation aligns with human judgment, enabling rigorous assessment and accelerating progress toward robust video intelligence.

📄 PDF Abstract BibTeX arXiv:2602.21835

Code (0)

등록된 구현이 없습니다.

Tasks

Instruction FollowingVideo ReconstructionVideo Generation

Similar Papers 제목 키워드 기반

FullDiT: Multi-Task Video Generative Foundation Model with Full Attention

2025-03-25 · Xuan Ju, Weicai Ye, Quande Liu, Qiulin Wang 외

Current video generative foundation models primarily focus on text-to-video tasks, providing limited control for fine-grained video content creation. Although adapter-based approaches (e.g., ControlNet) enable additional…

Video Generation

Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation

2025-08-07 · Yue Liao, Pengfei Zhou, Siyuan Huang, Donglin Yang 외 arxiv

We introduce Genie Envisioner (GE), a unified world foundation platform for robotic manipulation that integrates policy learning, evaluation, and simulation within a single video-generative framework. At its core, GE-Bas…

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

2026-07-13 · Xinghang Li, Jun Guo, Qiwei Li, Long Qian 외 hf

Recent foundation image and video generation models offer strong generalization and controllability, but their direct application to embodied scenarios is limited by requirements for multi-view consistency, geometric coh…

Text-to-Image GenerationScene GenerationVideo GenerationImage Editing

Unified Video-Action Joint Denoising for Dexterous Action and Data Generation

2026-06-02 · Dingrui Wang, YuAn Wang, Jinkun Liu, Yue Zhang 외 arxiv

Recent world action models leverage video foundation models by aligning broad visual-dynamics priors with executable robot actions. We revisit this alignment from a distributional perspective. Existing formulations typic…

SurgBench: A Unified Large-Scale Benchmark for Surgical Video Analysis

2025-06-09 · Jianhui Wei, Zikai Xiao, Danyu Sun, Luqi Gong 외

Surgical video understanding is pivotal for enabling automated intraoperative decision-making, skill assessment, and postoperative quality improvement. However, progress in developing surgical video foundation models (FM…

Action ClassificationBenchmarkingDecision MakingDomain Generalization+2