arrow
返回

Optimizing Sparse Matrix Convolution on RISC-V Core: Custom Instructions for Embedded System

delete2025-10-09
delete0
PRE
AI
H
Huachen Zhang
J
Jianyang Ding
B
Bowen Jiang
T
Tianshuo Lu
徐
徐伟 (Wei Xu)
Z
Zhilei Chai
DOI:10.1145/3756322delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
随着对嵌入式平台上深度神经网络(DNN)推理任务需求的不断增加,在资源受限的嵌入式平台上部署计算密集型DNN面临挑战。虽然稀疏化技术提供了一种潜在解决方案,但其在对边缘平台的实施仍存在困难。在本文中,我们提出了一种基于RISC-V架构的新型稀疏卷积加速处理器,并设计了专用定制指令以实现高效的边缘DNN推理。为此,我们主要解决了三个技术问题。针对稀疏卷积的数值特性,所设计的处理器能够实现一种硬件友好的架构,将卷积转换为稀疏矩阵乘法。此外,它采用列优先和元素级并行策略来优化Gustavson算法中存在的负载不均衡问题,从而增强稀疏矩阵计算。为进一步提高计算效率,我们的工作通过集成高效的执行单元来设计,这些单元在减少指令执行开销的同时最小化内存访问频率。与传统加速器相比,我们的工作支持C编程语言中的定制指令格式,提供更优越的灵活性。广泛的实验结果表明,与常规指令集相比,当运行大多数包含卷积操作的DNN时,我们的工作可将执行时间减少超过70%。此外,我们的工作的功能已在FPGA平台上得到验证,其性能基于55 nm CMOS工艺进行了全面评估。结果表明,在大多数网络推理任务中,我们的工作可实现675 GOPS/W的峰值能效比,展示了卓越的计算性能和能效。

期刊

ACM Transactions on Embedded Computing Systems 封面图
ACM Transactions on Embedded Computing Systems
IF:
2.6
论文数:
237
被引数:
2.3K

机构

暂无机构信息
引用论文

引用论文

暂无论文信息