paper-with-me

홈 › Papers

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

2026-04-13 · Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan arxiv

Current multimodal large language models (MLLMs) have demonstrated remarkable capabilities in short-form video understanding, yet translating long-form cinematic videos into detailed, temporally grounded scripts remains a significant challenge. This paper introduces the novel video-to-script (V2S) task, aiming to generate hierarchical, scene-by-scene scripts encompassing character actions, dialogues, expressions, and audio cues. To facilitate this, we construct a first-of-its-kind human-annotated benchmark and propose a temporally-aware hierarchical evaluation framework. Furthermore, we present OmniScript, an 8B-parameter omni-modal (audio-visual) language model tailored for long-form narrative comprehension. OmniScript is trained via a progressive pipeline that leverages chain-of-thought supervised fine-tuning for plot and character reasoning, followed by reinforcement learning using temporally segmented rewards. Extensive experiments demonstrate that despite its parameter efficiency, OmniScript significantly outperforms larger open-source models and achieves performance comparable to state-of-the-art proprietary models, including Gemini 3-Pro, in both temporal localization and multi-field semantic accuracy.

📄 PDF Abstract BibTeX arXiv:2604.11102

Code (0)

등록된 구현이 없습니다.

Tasks

Reinforcement Learning

Similar Papers 제목 키워드 기반

StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration

2026-05-25 · Linrui Tian, Qi Wang, Bang Zhang arxiv

Real-time streaming joint audio-video generation for character animation requires a generator to speak the requested transcript, maintain visual identity across chunks, and run within a strict playback budget. These requ…

Video GenerationVideo Denoising

Long-Video Audio Synthesis with Multi-Agent Collaboration

2025-03-13 · Yehang Zhang, Xinli Xu, Xiaojie Xu, Li Liu 외

Video-to-audio synthesis, which generates synchronized audio for visual content, critically enhances viewer immersion and narrative coherence in film and interactive media. However, video-to-audio dubbing for long-form c…

Audio SynthesisScene SegmentationScript Generation

NowYouSee Me: Context-Aware Automatic Audio Description

2024-12-13 · Seon-Ho Lee, Jue Wang, David Fan, Zhikang Zhang 외

Audio Description (AD) plays a pivotal role as an application system aimed at guaranteeing accessibility in multimedia content, which provides additional narrations at suitable intervals to describe visual elements, cate…

Event DetectionScript Generation

DANTE-AD: Dual-Vision Attention Network for Long-Term Audio Description

2025-03-31 · Adrienne Deganutti, Simon Hadfield, Andrew Gilbert

Audio Description is a narrated commentary designed to aid vision-impaired audiences in perceiving key visual elements in a video. While short-form video understanding has advanced rapidly, a solution for maintaining coh…

Video DescriptionVideo UnderstandingVisual Storytelling

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

2026-06-12 · Xinyue Cai, Chaoyou Fu, Yi-Fan Zhang, Ran He 외 arxiv

Current automated pipelines for audio-visual Question Answering (QA) generally adopt a ``video-caption-QA'' paradigm. However, these methods typically segment videos into short clips and generate separate descriptions fo…

Audio-visual Question AnsweringVisual Reasoning