arrow
返回

An efficient DSP packing framework for FPGA-based mixed-precision DCNN processor

delete2025-11-19
delete0
PRE
AI
X
Xueming Li
J
Jinhui Pan
H
Hongmin Huang
Y
Yuanmiao Lin
X
Xianghong Hu *
S
Shuting Cai *
X
Xiaoming Xiong
DOI:10.1016/j.sysarc.2025.103627delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
混合精度量化在模型精度与存储之间为深度卷积神经网络(DCNNs)提供了极具吸引力的平衡,但其部署性能在可编程逻辑门阵列(FPGAs)上依赖于将多个低精度乘法打包进单个数字信号处理器(DSP)的微架构能力。然而,现有的DSP打包技术难以在硬件消耗与支持的位宽组合多样性之间取得有效平衡,从而阻碍了混合精度量化算法的丰富搜索空间被充分利用。在本文中,提出了一种硬件高效的DSP打包框架,支持广泛位宽组合且开销最小。首先,本文提出了一种新颖的有符号DSP打包策略,命名为Multiplication-Correction(MC),该策略消除了近似计算并实现了乘法并行性的易扩展。其次,基于MC策略提出了一种支持12种位宽组合的乘-累加单元(MACU),与先前工作相比,其将查找表(LUT)消耗降低了1.7倍,同时提供了增强的配置性。最后,提出了一种具有高度流水线数据流的DCNN处理器,通过减少不必要的片外数据传输来提高深度可分离卷积(DSC)的计算效率。所提出的混合精度DCNN处理器在MobileNet-v1上达到336.9 GOPS,对应20.54 GOPS/kLUT/GHz和3.76 GOPS/DSP/GHz。与先前工作相比,本设计实现了4.82倍的更高LUT效率和3.58倍的更高DSP效率。

期刊

Journal of Systems Architecture 封面图
Journal of Systems Architecture
IF:
4.1
论文数:
3.0K
被引数:
4.2K

机构

G
Guangdong Polytechnic Normal University
学者数:
1.6K
论文数: 1.4K
被引数: 1.1K
G
guangdong university of technology
学者数:
3.0W
论文数: 2.0W
被引数: 36
引用论文

引用论文

暂无论文信息