返回
FPGA-based CNN accelerator using Convolutional Processing Element to reduce idle states
DOI:10.1016/j.sysarc.2025.103468.png)
摘要
En 中文
目标检测一直是机器视觉系统中的一个重要挑战。基于硬件的各种加速器已被用于提升速度效率。这些加速器的主要目标是最小化DSP模块的空闲状态。本文提出了一种基于卷积处理单元(CPEs)的新架构,其中权重被存储,并在内部CPE缓冲区中进行循环移位,用于生成输出特征图。通过这种方式,通过增加CPE中的数据重用和减少外部内存访问来降低DSP的空闲状态。用于加速CNN的CPE数量取决于所需速度和可用硬件资源;可利用16、32、64、128和256个CPE的配置来加速所需的卷积神经网络(CNN)。为证明所提出架构的有效性,将其应用于YOLOv3-Tiny目标检测CNN。实验结果表明,在Xilinx XCKU060 FPGA上,使用200 MHz工作频率和16位定点表示时,本架构的128个CPE核心可实现62.8帧/秒的运行速度。该方法在仅导致mAP下降1%的情况下,使用了43.2K LUTs、94.4K FFs、26.73 Mbits RAM和1364个DSP。此外,与最先进的系统相比,外部内存芯片数量减少了67%。
期刊
IF:
4.1
论文数:
3.0K
被引数:
4.2K
机构
引用论文
On-chip hyperspectral image segmentation with fully convolutional networks for scene understanding in autonomous driving基于全卷积网络的片上高光谱图像分割,用于自动驾驶中的场景理解
Pflow: An end-to-end heterogeneous acceleration framework for CNN inference on FPGAsPflow: fpga上CNN推理的端到端异构加速框架
A Novel FPGA Accelerator Design for Real-Time and Ultra-Low Power Deep Convolutional Neural Networks Compared With Titan X GPU
IEEE ACCESS
IF3.6

