paper-with-me

Video Generation

16개 벤치마크 · 논문 2,911편 · 이 태스크의 논문 보기 →

Benchmarks

UCF-101

결과 96개

BAIR Robot Pushing

결과 62개

Sky Time-lapse

결과 18개

LAION-400M

결과 12개

Taichi

결과 12개

How2Sign

결과 2개

Kinetics-700

결과 2개

MSR-VTT

결과 2개

TrailerFaces

결과 2개

YouTube Driving

결과 2개

Most implemented

Consistency Models

2023-03-02 · 구현 15개

Everybody Dance Now

2018-08-22 · 구현 14개

Video Diffusion Models

2022-04-07 · 구현 5개

Papers

Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation

2026-09-10 · Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang 외 hf

We present Vidu S2, which comprises Vidu S2-Avatar, a real-time interactive digital-character model, and Vidu S2-Editing, a real-time video editing model. Moreover, we explore the feasibility of real-time spatial video g…

Instruction FollowingVideo Generation

Mask Forcing: Improving Autoregressive Video Diffusion Distillation via Dual-Noise Masking Rollout

2026-09-08 · Zhuoran Zhao, Shengju Qian, Tongtong Liang, Xianghao Kong 외 hf

Autoregressive (AR) video diffusion models have shown great potential in real-time video generation. Recent methods distill pretrained bidirectional video diffusion models into causal AR students through Distribution Mat…

Video Generation

RoLA: Rotary-Positioned Low-Rank Linear Attention for Efficient Diffusion Transformers

2026-09-06 · Zekun Zhang, Yixiang Cai, Yuxi Liu, Tengxu Sun 외 arxiv

Diffusion Transformers (DiTs) achieve strong video generation quality, but their dense spatiotemporal self-attention scales quadratically with sequence length and quickly becomes the dominant inference bottleneck. Sparse…

Video Generation

Multi-Grid Post-Training for Long-Form Multi-Shot Video Generation

2026-09-06 · Jiawei Mao, Haoqin Tu, Hardy Chen, Yuhan Wang 외 hf

Generating long-form multi-shot videos requires coherent within-shot motion and visually consistent narratives across shots. Existing video generators favor continuous motion and struggle to present complete shot sets wh…

Video Generation

TourPhysics: Bringing Physics to World Models for Exploration and Manipulation from a Single Image

2026-09-04 · Xin Zhang, Yabo Chen, Zixuan Duan, Haibin Huang 외 arxiv

Interactive visual world models must distinguish observation from physical intervention. Camera motion reveals new surfaces, whereas intervention changes object motion, contact, and deformation. Current video world model…

Video Generation

PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation

2026-09-04 · Yuchen Sun, Qian Yang, Jun Wang, Detai Xin 외 arxiv

Text-to-audio-video (T2AV) generation has advanced rapidly, but its evaluation still underestimates the audio modality. Existing benchmarks either treat audio as an auxiliary component of video quality or assess it in is…

Audio GenerationVideo Generation

전체 2,911편 보기 →