返回
A survey on versatile embedded Machine Learning hardware acceleration
DOI:10.1016/j.sysarc.2025.103501.png)
摘要
En 中文
本研究调查了多功能嵌入式机器学习(ML)硬件加速的最新进展。分析了在资源受限设备上高效实现机器学习算法的各种架构方法,重点关注三个关键方面:性能优化、嵌入式系统考量(吞吐量、延迟、能效)和多应用支持。然而,它并未考虑机器学习架构自身的攻击与防御。随后,该综述探讨了不同的硬件加速策略,从定制RISC-V指令到专用处理单元(PEs)、存内计算(PiM)架构和协同设计方法。显著创新包括灵活的位精度支持、可重构PEs以及针对权重和(超)参数移动开销优化的内存管理技术。接着,这些架构基于上述关键方面进行评估。我们的分析表明,相关且稳健的嵌入式ML加速需要根据应用,仔细权衡计算能力、功耗和架构灵活性之间的取舍。
期刊
IF:
4.1
论文数:
3.0K
被引数:
4.2K
机构
引用论文
Dynamic FPGA reconfiguration for scalable embedded artificial intelligence (AI): A co-design methodology for convolutional neural networks (CNN) acceleration可扩展嵌入式人工智能(AI)的动态FPGA重构:一种用于卷积神经网络(CNN)加速的协同设计方法
Design and Implementation of Convolutional Neural Networks Accelerator Based on Multidie基于Multidie的卷积神经网络加速器的设计与实现
IEEE ACCESS
IF3.6
Research on Convolutional Neural Network Inference Acceleration and Performance Optimization for Edge Intelligence面向边缘智能的卷积神经网络推理加速与性能优化研究
SENSORS
IF3.5
A Novel Systolic Parallel Hardware Architecture for the FPGA Acceleration of Feedforward Neural Networks一种用于前馈神经网络FPGA加速的新型脉动并行硬件架构
IEEE ACCESS
IF3.6

