arrow
返回

FPGA-based CNN accelerator using Convolutional Processing Element to reduce idle states

delete2025-06-06
delete0
PRE
AI
M
Mohammad Dehnavi *
A
Aran Ghasemi
B
Bijan Alizadeh
DOI:10.1016/j.sysarc.2025.103468delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
目标检测一直是机器视觉系统中的一个重要挑战。基于硬件的各种加速器已被用于提升速度效率。这些加速器的主要目标是最小化DSP模块的空闲状态。本文提出了一种基于卷积处理单元(CPEs)的新架构,其中权重被存储,并在内部CPE缓冲区中进行循环移位,用于生成输出特征图。通过这种方式,通过增加CPE中的数据重用和减少外部内存访问来降低DSP的空闲状态。用于加速CNN的CPE数量取决于所需速度和可用硬件资源;可利用16、32、64、128和256个CPE的配置来加速所需的卷积神经网络(CNN)。为证明所提出架构的有效性,将其应用于YOLOv3-Tiny目标检测CNN。实验结果表明,在Xilinx XCKU060 FPGA上,使用200 MHz工作频率和16位定点表示时,本架构的128个CPE核心可实现62.8帧/秒的运行速度。该方法在仅导致mAP下降1%的情况下,使用了43.2K LUTs、94.4K FFs、26.73 Mbits RAM和1364个DSP。此外,与最先进的系统相比,外部内存芯片数量减少了67%。

期刊

Journal of Systems Architecture 封面图
Journal of Systems Architecture
IF:
4.1
论文数:
3.0K
被引数:
4.2K

机构

U
University of Tehran
学者数:
2.4W
论文数: 2.3W
被引数: 2.7W
K
Kermanshah University of Technology
学者数:
579
论文数: 870
被引数: 0
引用论文

引用论文

On-chip hyperspectral image segmentation with fully convolutional networks for scene understanding in autonomous driving基于全卷积网络的片上高光谱图像分割,用于自动驾驶中的场景理解
err2023-06-01
err7
errOAAI
errGutierrez-Zaballa, Jon; Basterretxea, Koldo; Echanobe, Javier; Martinez, M. Victoria; Martinez-Corral, Unai; Mata-Carballeira, Oscar; del Campo, Ines
err分享
err收藏
A Reconfigurable Neural Network Processor With Tile-Grained Multicore Pipeline for Object Detection on FPGA
err
IF0
err2021-11-01
err0
PREAI
errLibo Chang; Shengbing Zhang; Huimin Du; Yue Chen; Shiyu Wang
err分享
err收藏
err分享
err收藏
An Efficient CNN Accelerator Using Inter-Frame Data Reuse of Videos on FPGAs
err2022-11-01
err0
PREAI
errShengzhao Li; Qin Wang; Jianfei Jiang; Weiguang Sheng; Naifeng Jing; Zhigang Mao
err分享
err收藏
Mask R-CNN面具r-cnn
err2017-10-01
err0
PREAI
errKaiming He; Georgia Gkioxari; Piotr Dollar; Ross Girshick
err分享
err收藏
An automotive case study on the limits of approximation for object detection
err2023-05-01
err2
errOAAI
errCaro, Marti; Tabani, Hamid; Abella, Jaume; Moll, Francesc; Morancho, Enric; Canal, Ramon; Altet, Josep; Calomarde, Antonio; Cazorla, Francisco J.; Rubio, Antonio; Fontova, Pau; Fornt, Jordi
err分享
err收藏
A Novel FPGA Accelerator Design for Real-Time and Ultra-Low Power Deep Convolutional Neural Networks Compared With Titan X GPU
err2020-01-01
err30
errOAAI
errLi, Shuai; Luo, Yukui; Sun, Kuangyuan; Yadav, Nandakishor; Choi, Kyuwon Ken
err分享
err收藏
err分享
err收藏
FP-BNN: Binarized neural network on FPGAFp-bnn: 基于FPGA的二值化神经网络
err2018-01-01
err222
PREAI
errLiang, Shuang; Yin, Shouyi; Liu, Leibo; Luk, Wayne; Wei, Shaojun
err分享
err收藏
学者 查看更多内容