返回
Fb-FaceBoxes: FPGA-based face detection using repetitive kernels and memory-access optimization
DOI:10.1007/s11554-026-01954-5.png)
摘要
En 中文
人脸检测是许多计算机视觉应用中的关键第一步,随着卷积神经网络(CNNs)的出现已取得显著进展。尽管这些算法有效,但基于CNN的算法通常需要大量计算资源,因此使用FPGA进行硬件加速对于实时处理至关重要。FaceBoxes作为最准确的人脸检测算法之一,由于其高计算复杂度,对FPGA实现提出了特殊挑战。本文提出了一种基于FPGA的受FaceBoxes启发的CNN,显著降低了硬件资源利用率和内存访问需求。所提出的网络增加了层数同时减小了滤波器尺寸,并提出了一个针对该网络的优化硬件架构。该设计仅使用$$3 \times 3$$卷积核,与原始FaceBoxes网络相比,精度仅下降2.8%,同时减少了3%的参数数量。实验结果表明,所提出的架构在XC7K325 FPGA上以250 MHz运行且采用18位定点精度时,可实现33帧每秒的处理速度。该实现使用了23K LUTs、45K FFs、14.4 Mbits的RAM和768个DSP,展示了高效率及适用于实时人脸检测应用的可行性。
Keyword:
Face detection
Deep learning
Convolutional neural network
FPGA
FaceBoxes
Optimization
期刊
IF:
3
论文数:
396
被引数:
2.0K
机构
引用论文
FPGA-based CNN accelerator using Convolutional Processing Element to reduce idle states基于FPGA的CNN加速器,采用卷积处理单元以减少空闲状态
Fcd-cnn: FPGA-based CU depth decision for HEVC intra encoder using CNNFcd-cnn: 基于FPGA的CU深度决策HEVC帧内编码器,使用CNN
Comprehensive comparison between vision transformers and convolutional neural networks for face recognition tasks
SCIENTIFIC REPORTS
IF3.9
A High-Throughput and Power-Efficient FPGA Implementation of YOLO CNN for Object Detection用于目标检测的YOLO CNN的高吞吐量和节能FPGA实现

