Return
PiT: Progressive diffusion transformer
DOI:10.1016/j.patcog.2026.114732.png)
Abstract
En 中文
<ul class="list">
<li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content">
<div class="u-margin-s-bottom" id="d1e2559">
DiT does not rely on long-distance attention, Static Window Attention is proposed.
</div></span></li>
<li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content">
<div class="u-margin-s-bottom" id="d1e2564">
Pseudo Shifted Window Attention is introduced to enhance high-frequency information.
</div></span></li>
<li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content">
<div class="u-margin-s-bottom" id="d1e2569">
We pioneer the concept of Kth-order attention in visual generation.
</div></span></li>
<li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content">
<div class="u-margin-s-bottom" id="d1e2574">
Progressive Coverage Channel Allocation enables effective Kth-order attention.
</div></span></li>
<li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content">
<div class="u-margin-s-bottom" id="d1e2579">
PiT, a new vision backbone, achieves SOTA performance and is 2.46× faster than DiT.
</div></span></li>
</ul>
Keywords:
Image generation
Diffusion transformer
Attention similarity

