返回
CIMFlow: Modelling Dataflow in Cross-Layer Compute-in-Memory Deep Learning Accelerators
DOI:10.1145/3760780.png)
摘要
En 中文
传统深度学习加速器(DLAs)依赖片外存储器存储大型权重张量,导致高带宽需求和能耗。存内计算(CIM)加速器通过集成高密度非易失性存储器阵列缓解这一问题,实现完全权重驻留(FWS)数据流。多核CIM系统通过跨层推理进一步提升效率,其中中间张量保持在片上,核心以流水线方式运行。尽管存在多种架构提案,但现有工具无法建模多核CIM加速器的数据流、存储器访问模式及时序行为。我们提出CIMFlow,一种用于跨层CIM架构的建模框架。我们的灵活硬件架构模型包含CIM和数字核心,并利用缓冲存储惯用法实现分布式基于令牌的流控制。基于Array-OL的工作负载模型捕获卷积神经网络(CNN)的多维依赖关系,并应用硬件感知变换。这些模型被转换为带时序的循环静态数据流图进行仿真。CIMFlow提供延迟、能耗以及核心和缓冲器利用率跟踪。针对前沿CNN的案例研究表明,跨层推理可将延迟降低高达52倍。我们还发现,忽略存储器访问延迟会导致吞吐量高估高达308%。据我们所知,CIMFlow是首个聚焦FWS跨层执行且显式建模数据移动成本的CIM架构工具。它为下一代CIM加速器的设计空间探索提供了强大的成本模型。
Keyword:
Compute-in-memory
cross-layer
dataflow simulation
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
2.6
论文数:
227
被引数:
2.3K
机构
引用论文
A Calibratable Model for Fast Energy Estimation of MVM Operations on RRAM Crossbars一种可校准的模型,用于RRAM交叉阵列上矩阵-向量乘法操作(MVM)的快速能量估算
Array-OL with delays, a domain specific specification language for multidimensional intensive signal processing带延迟的Array-OL,一种面向多维密集信号处理的领域特定规范语言
Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow AcceleratorsStream: 异构数据流加速器上的层融合dnn的设计空间探索
A Heterogeneous and Programmable Compute-In-Memory Accelerator Architecture for Analog-AI Using Dense 2-D Mesh使用密集二维网格的模拟AI的异构和可编程内存计算加速器架构

