arrow
Return

PiT: Progressive diffusion transformer

delete2026-08-25
delete0
PRE
AI
J
Jiafu Wu
Y
Yabiao Wang
J
Jian Li
J
Jinlong Peng
Y
Yun Cao
C
Chengjie Wang
J
Jiangning Zhang
Y
Yong Liu *
DOI:10.1016/j.patcog.2026.114732delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
<ul class="list"> <li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content"> <div class="u-margin-s-bottom" id="d1e2559"> DiT does not rely on long-distance attention, Static Window Attention is proposed. </div></span></li> <li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content"> <div class="u-margin-s-bottom" id="d1e2564"> Pseudo Shifted Window Attention is introduced to enhance high-frequency information. </div></span></li> <li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content"> <div class="u-margin-s-bottom" id="d1e2569"> We pioneer the concept of Kth-order attention in visual generation. </div></span></li> <li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content"> <div class="u-margin-s-bottom" id="d1e2574"> Progressive Coverage Channel Allocation enables effective Kth-order attention. </div></span></li> <li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content"> <div class="u-margin-s-bottom" id="d1e2579"> PiT, a new vision backbone, achieves SOTA performance and is 2.46× faster than DiT. </div></span></li> </ul>
Keywords:
Image generation
Diffusion transformer
Attention similarity

Journal

Pattern Recognition cover
Pattern Recognition
IF:
7.6
Papers:
1.3W
Citations:
4.5W

Organization

T
Tencent
Scholars:
1.1K
Papers: 893
Citations: 5
Z
zhejiang university
Scholars:
17.4W
Papers: 12.0W
Citations: 152