paper-with-me

Papers

Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints

2024-11-26 · Guanjie Chen, Xinyu Zhao, Yucheng Zhou, Xiaoye Qu, Tianlong Chen, Yu Cheng

Diffusion Transformers (DiT) have emerged as a powerful architecture for image and video generation, offering superior quality and scalability. However, their practical application suffers from inherent dynamic feature instability, leading to error amplification during cached inference. Through systematic analysis, we identify the absence of long-range feature preservation mechanisms as the root cause of unstable feature propagation and perturbation sensitivity. To this end, we propose Skip-DiT, a novel DiT variant enhanced with Long-Skip-Connections (LSCs) - the key efficiency component in U-Nets. Theoretical spectral norm and visualization analysis demonstrate how LSCs stabilize feature dynamics. Skip-DiT architecture and its stabilized dynamic feature enable an efficient statical caching mechanism that reuses deep features across timesteps while updating shallow components. Extensive experiments across image and video generation tasks demonstrate that Skip-DiT achieves: (1) 4.4 times training acceleration and faster convergence, (2) 1.5-2 times inference acceleration without quality loss and high fidelity to original output, outperforming existing DiT caching methods across various quantitative metrics. Our findings establish long-skip connections as critical architectural components for training stable and efficient diffusion transformers.

📄 PDF Abstract BibTeX arXiv:2411.17616

Code (1)

opensparsellms/skip-dit 공식 구현 pytorch

Tasks

DenoisingImage GenerationVideo Generation

Methods 이 논문이 사용한 방법론

Diffusion Diffusion models generate samples by gradually removing noise from a signal, and their training objective can be expressed as a reweighted variational lower-bound…

Similar Papers 제목 키워드 기반

DISK: Dynamic Inference SKipping for World Models

2026-01-31 · Anugunj Naman, Gaibo Zhang, Ayushman Singh, Yaguang Zhang arxiv

We present DISK, a training-free adaptive inference method for autoregressive world models. DISK coordinates two coupled diffusion transformers for video and ego-trajectory via dual-branch controllers with cross-modal sk…

Trajectory Prediction

Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping

2026-03-21 · Sunghyun Park, Jeongho Kim, Hyoungwoo Park, Debasmit Das 외 arxiv

Diffusion Transformers (DiTs) have significantly enhanced text-to-image (T2I) generation quality, enabling high-quality personalized content creation. However, fine-tuning these models requires substantial computational …

Cutting the Skip: Training Residual-Free Transformers

2025-09-30 · Yiping Ji, James Martens, Jianqiao Zheng, Ziqin Zhou 외 arxiv

Transformers have achieved remarkable success across a wide range of applications, a feat often attributed to their scalability. Yet training them without skip (residual) connections remains notoriously difficult. While …

Representation Learning

All are Worth Words: A ViT Backbone for Diffusion Models

2022-09-25 · CVPR 2023 1 · Fan Bao, Shen Nie, Kaiwen Xue, Yue Cao 외

Vision transformers (ViT) have shown promise in various vision tasks while the U-Net based on a convolutional neural network (CNN) remains dominant in diffusion models. We design a simple and general ViT-based architectu…

AllConditional Image GenerationImage GenerationText to Image Generation+1

LiteAttention: A Temporal Sparse Attention for Diffusion Transformers

2025-11-14 · Dor Shmilovich, Tony Wu, Aviad Dahan, Yuval Domb arxiv

Diffusion Transformers, particularly for video generation, achieve remarkable quality but suffer from quadratic attention complexity, leading to prohibitive latency. Existing acceleration methods face a fundamental trade…

Video Generation