返回
Single-Step Hardware-Aware Neural Network Quantization With Mixed Precision
DOI:10.1109/TC.2026.3666546.png)
摘要
En 中文
量化是一种神经网络压缩技术,可有效提升推理硬件上的部署性能。定点量化方法对网络中的所有层使用相同的位宽,这导致难以平衡压缩率与精度损失。因此,混合精度量化方法近年来被提出。混合精度量化的主要挑战是如何选择网络中各层的量化位宽,以同时满足最小化精度损失和硬件资源消耗的要求。在本文中,我们提出了一种单步硬件感知量化(SHQ)方法。它可以在实际部署前计算硬件(如现场可编程门阵列FPGA)的资源消耗,并通过单步找到有效的量化方案,与常见的工作量大、耗时的软硬件两步方法不同。我们将遗传算法与SHQ结合,以搜索低硬件资源使用和高精度的量化方案。此外,分析了硬件资源成本与代理信号定性指标之间的相关性,为神经网络加速器的计算机辅助设计提供了见解。在FPGA平台上的全流水线加速器部署实验表明,与全8位量化相比,我们的方法在MobileNet上节省了39%的数字信号处理器(DSP)和59%的块随机存取存储器(BRAM)使用量,而精度仅下降0.56%。关于我们方法的开源代码可以在以下链接找到:https://github.com/hujie369/SHQ。
Keyword:
Neural network
quantization
genetic algorithm
hardware-aware
期刊
IF:
3.8
论文数:
5.4K
被引数:
9.8K
机构
引用论文
A High-Performance Pixel-Level Fully Pipelined Hardware Accelerator for Neural Networks用于神经网络的高性能像素级全流水线硬件加速器
PEDSA: High-Throughput Pipeline-Based FPGA Accelerator for Convolutional Encoder–Decoder Segmentation NetworksPEDSA:基于高吞吐量流水线的FPGA加速器,用于卷积编码器-解码器分割网络
ReLeQ : A Reinforcement Learning Approach for Automatic Deep Quantization of Neural Networks
IEEE Micro
IF0

