paper-with-me

Papers

FullDiT: Multi-Task Video Generative Foundation Model with Full Attention

2025-03-25 · Xuan Ju, Weicai Ye, Quande Liu, Qiulin Wang, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Qiang Xu

Current video generative foundation models primarily focus on text-to-video tasks, providing limited control for fine-grained video content creation. Although adapter-based approaches (e.g., ControlNet) enable additional controls with minimal fine-tuning, they encounter challenges when integrating multiple conditions, including: branch conflicts between independently trained adapters, parameter redundancy leading to increased computational cost, and suboptimal performance compared to full fine-tuning. To address these challenges, we introduce FullDiT, a unified foundation model for video generation that seamlessly integrates multiple conditions via unified full-attention mechanisms. By fusing multi-task conditions into a unified sequence representation and leveraging the long-context learning ability of full self-attention to capture condition dynamics, FullDiT reduces parameter overhead, avoids conditions conflict, and shows scalability and emergent ability. We further introduce FullBench for multi-task video generation evaluation. Experiments demonstrate that FullDiT achieves state-of-the-art results, highlighting the efficacy of full-attention in complex multi-task video generation.

📄 PDF Abstract BibTeX arXiv:2503.19907

Code (0)

등록된 구현이 없습니다.

Tasks

Video Generation

Methods 이 논문이 사용한 방법론

Focus 설명 없음

Similar Papers 제목 키워드 기반

FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers

2025-06-04 · Xuanhua He, Quande Liu, Zixuan Ye, Weicai Ye 외

Fine-grained and efficient controllability on video diffusion transformers has raised increasing desires for the applicability. Recently, In-context Conditioning emerged as a powerful paradigm for unified conditional vid…

Video EditingVideo Generation

Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation

2025-12-02 · Jianzong Wu, Hao Lian, Dachao Hao, Ye Tian 외 arxiv

Recent audio-video generative systems suggest that coupling modalities benefits not only audio-video synchrony but also the video modality itself. We pose a fundamental question: Does audio-video joint denoising training…

Video Generation

In-Context Audio Control of Video Diffusion Transformers

2025-12-21 · Wenze Liu, Weicai Ye, Minghong Cai, Quande Liu 외 arxiv

Recent advancements in video generation have seen a shift towards unified, transformer-based foundation models that can handle multiple conditional inputs in-context. However, these models have primarily focused on modal…

Video Generation

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

2026-07-22 · Junyu Dai, Xinyue Fan, Weiqin Li, Xiangang Li 외 arxiv

In this report, we present a unified song generation framework capable of producing high-quality full-length music from lyrics, text descriptions, and musical attributes. The proposed framework supports three tasks: Lyri…

Music Generation

InternVideo: General Video Foundation Models via Generative and Discriminative Learning

2022-12-06 · Yi Wang, Kunchang Li, Yizhuo Li, Yinan He 외

The foundation models have recently shown excellent performance on a variety of downstream tasks in computer vision. However, most existing vision foundation models simply focus on image-level pretraining and adpation, w…

Action ClassificationAction RecognitionContrastive LearningOpen Set Action Recognition+8