返回
FDHA: Fusion-Driven Heterogeneous Accelerator for Efficient Diffusion Model Inference
DOI:10.1007/978-3-031-99857-7_6.png)
摘要
En 中文
扩散模型已成为生成式AI任务的有力工具。尽管以往研究主要关注消除时间步之间的冗余,但像Stable Diffusion这样的模型引入了残差网络-Transformer交替执行(RTAE)模式,其中卷积和注意力算子在每个时间步内顺序执行。这种执行模式由于卷积和Transformer操作特性的不匹配,导致过多的片上内存访问和计算资源利用率低下。为解决这些挑战,我们提出了FDHA,一种针对高效扩散模型推理的加速器。首先,为减少冗余的片上内存访问,FDHA引入了算子间数据流融合机制,通过策略性地对齐残差网络的卷积和Transformer的矩阵乘法维度,实现高效的核复用。其次,为最大化计算资源利用率,FDHA采用异构架构,配备专用的卷积处理单元和矩阵乘法张量处理单元,支持流水线执行。实验结果表明,FDHA相较于NVIDIA A100 GPU实现了3.28倍的加速,相较于SoTA扩散加速器实现了2.62倍的加速。
Keyword:
Diffusion Model Accelerator
Dataflow Optimization
Heterogeneous Architecture
期刊
E
IF:
0
论文数:
24
被引数:
0
机构
引用论文
DistriFusion: Distributed Parallel Inference for High-Resolution Diffusion ModelsDistriFusion:高分辨率扩散模型的分布式并行推理
没有更多内容

