arrow
返回

DA-VinCi: A Deep-Learning Accelerator Overlay Using In-Memory Computing

delete2025-11-21
delete0
delete
OA
AI
M
MD Arafat Kabir
N
Nathaniel Fredricks
T
Tendayi Kamucheka
J
Joel Mandebi Mbongue
M
Miaoqing Huang
J
Jason D. Bakos
D
David Andrews
DOI:10.1145/3770756delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
当今深度学习模型所依赖的矩阵运算通常会实现在单指令多数据(SIMD)领域专用加速器中。包括GPU和阵列处理器的SIMD加速器可以有效利用计算密集型模型中的并行性,但其有效性可能会因内存密集型模型而降低。正在探索存储器内处理(PIM)架构,以提供这些内存密集型模型更好的能效和可扩展性能。现代现场可编程门阵列(FPGA)具有数百兆比特的静态随机存取存储器(SRAM),作为分布式解耦内存资源分布在设备上。这使得FPGA成为开发定制存储器内/近存储加速器的理想可编程平台。已提出多种基于PIM阵列的加速器设计,以利用这一巨大的内部带宽。然而,至今报道的结果显示,基于FPGA的PIM架构在系统时钟频率下运行,远低于芯片块随机存取存储器(BRAM)的最大时钟频率(Fmax)。结果还表明,设计中的计算密度与BRAM密度并非线性增长。这些结果表明,FPGA PIM架构将永远无法与定制的专用集成电路(ASIC)相竞争。
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

ACM Transactions on Reconfigurable Technology and Systems 封面图
ACM Transactions on Reconfigurable Technology and Systems
IF:
2.8
论文数:
598
被引数:
810

机构

暂无机构信息
引用论文

引用论文

暂无论文信息