返回
Optimizing Sparse Matrix Convolution on RISC-V Core: Custom Instructions for Embedded System
DOI:10.1145/3756322.png)
摘要
En 中文
随着对嵌入式平台上深度神经网络(DNN)推理任务需求的不断增加,在资源受限的嵌入式平台上部署计算密集型DNN面临挑战。虽然稀疏化技术提供了一种潜在解决方案,但其在对边缘平台的实施仍存在困难。在本文中,我们提出了一种基于RISC-V架构的新型稀疏卷积加速处理器,并设计了专用定制指令以实现高效的边缘DNN推理。为此,我们主要解决了三个技术问题。针对稀疏卷积的数值特性,所设计的处理器能够实现一种硬件友好的架构,将卷积转换为稀疏矩阵乘法。此外,它采用列优先和元素级并行策略来优化Gustavson算法中存在的负载不均衡问题,从而增强稀疏矩阵计算。为进一步提高计算效率,我们的工作通过集成高效的执行单元来设计,这些单元在减少指令执行开销的同时最小化内存访问频率。与传统加速器相比,我们的工作支持C编程语言中的定制指令格式,提供更优越的灵活性。广泛的实验结果表明,与常规指令集相比,当运行大多数包含卷积操作的DNN时,我们的工作可将执行时间减少超过70%。此外,我们的工作的功能已在FPGA平台上得到验证,其性能基于55 nm CMOS工艺进行了全面评估。结果表明,在大多数网络推理任务中,我们的工作可实现675 GOPS/W的峰值能效比,展示了卓越的计算性能和能效。

