返回
DiffAccel: Accelerating Diffusion Models Through Adaptive Feature Optimization and Dynamic Hardware Adaptation
DOI:10.1109/TVLSI.2025.3604419.png)
摘要
En 中文
扩散模型(DMs)已作为一种革命性技术在AI生成内容领域崭露头角。尽管其生成内容质量优越,DMs的部署仍面临两大关键挑战:1)其迭代去噪过程固有的高昂计算成本;2)优化其多尺度U-Net架构执行时的复杂性,该架构在各层表现出多样化的计算模式与不同的内存需求。现有的优化方法在算法层面和硬件层面均存在局限性。在算法层面,现有方法难以通过均匀通道处理实现高效特征增强,且静态缓存策略导致特征复用不灵活。在硬件层面,当前解决方案缺乏适应U-Net内多样化计算和内存需求所需的灵活性与效率。为应对这些挑战,我们提出DiffAccel,一种算法-硬件协同优化的加速器,旨在加速各类DMs的推理过程。首先,引入两项关键算法创新:仅针对高维通道的选性特征增强,以及基于识别到的演化模式的自适应特征缓存机制。其次,在硬件层面,提出一种可重构阵列(RA),通过根据各层特定计算模式在输出驻留(OS)和权重驻留(WS)数据流模式间切换,实现高效执行跨不同U-Net层。此外,实现了一种数据量感知的内存管理单元(MMU),采用自适应输入分配和分层输出存储,高效管理U-Net各异的层内存占用,从而提升片上内存效率并减少浪费。第三,对关键U-Net操作序列采用细粒度流水线融合,以最小化中间数据移动并显著降低延迟。具体而言,对线性–Softmax操作采用行优先处理,对卷积–组归一化(GNorm)序列采用通道优先输出。在算法层面,DiffAccel相较于基准稳定扩散(SD)v2.0实现2.93倍加速,并将计算复杂度从105 TFLOPs降至69 TFLOPs。DiffAccel采用28纳米工艺实现。在硬件效率方面,基于后布局布线(P&R)实现结果,DiffAccel相较于当前最优(SOTA)加速器实现5.25倍至5.79倍的更高吞吐量,并保持相当的面积效率。
Keyword:
Diffusion models (DMs)
feature optimization
hardware adaptation
期刊
I
IF:
3.1
论文数:
487
被引数:
7.3K
机构
引用论文
暂无论文信息

