arrow
返回

FDHA: Fusion-Driven Heterogeneous Accelerator for Efficient Diffusion Model Inference

delete2026-01-01
delete0
PRE
AI
Y
Y. Mu
Z
Zhihua Fan *
X
Xiaoxia Yao
W
Wenming Li
Z
Zhiyuan Zhang
H
Honglie Wang
X
Xuejun An
X
Xiaochun Ye
DOI:10.1007/978-3-031-99857-7_6delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
扩散模型已成为生成式AI任务的有力工具。尽管以往研究主要关注消除时间步之间的冗余,但像Stable Diffusion这样的模型引入了残差网络-Transformer交替执行(RTAE)模式,其中卷积和注意力算子在每个时间步内顺序执行。这种执行模式由于卷积和Transformer操作特性的不匹配,导致过多的片上内存访问和计算资源利用率低下。为解决这些挑战,我们提出了FDHA,一种针对高效扩散模型推理的加速器。首先,为减少冗余的片上内存访问,FDHA引入了算子间数据流融合机制,通过策略性地对齐残差网络的卷积和Transformer的矩阵乘法维度,实现高效的核复用。其次,为最大化计算资源利用率,FDHA采用异构架构,配备专用的卷积处理单元和矩阵乘法张量处理单元,支持流水线执行。实验结果表明,FDHA相较于NVIDIA A100 GPU实现了3.28倍的加速,相较于SoTA扩散加速器实现了2.62倍的加速。
Keyword:
Diffusion Model Accelerator
Dataflow Optimization
Heterogeneous Architecture

期刊

E
EURO-PAR 2025: PARALLEL PROCESSING, PT II
IF:
0
论文数:
24
被引数:
0

机构

I
institute of computing technology, cas
学者数:
1.0K
论文数: 878
被引数: 1
C
chinese academy of sciences
学者数:
56.7W
论文数: 45.0W
被引数: 704
引用论文

引用论文

err分享
err收藏
Cambricon-D: Full-Network Differential Acceleration for Diffusion Models
err
IF0
err2024-06-29
err0
PREAI
errWeihao Kong; Yifan Hao; Qi Guo; Yongwei Zhao; Xinkai Song; Xiaqing Li; Mo Zou; Zidong Du; Rui Zhang; Chang Liu; Yuanbo Wen; Pengwei Jin; Xing Hu; Wei Li; Zhiwei Xu; Tianshi Chen
err分享
err收藏
SDA: Low-Bit Stable Diffusion Acceleration on Edge FPGAs
err2024-09-02
err0
PREAI
errYang,Geng; Xie,Yanyue; Xue,Zhong Jia; Chang,Sung-En; Li,Yanyu; Dong,Peiyan; Lei,Jie; Xie,Weiying; Wang,Yanzhi; Lin,Xue; Fang,Zhenman
err分享
err收藏
没有更多内容