返回
A Novel Computational Model Enabling Continuous Differentiability in Neural Network Quantization
DOI:10.3390/app16115281.png)
摘要
En 中文
量化将神经网络参数精度降低以加速推理并降低功耗,但常导致明显的精度下降。我们提出了一种可微量化框架,用连续代理函数替代不可微的舍入操作。在QAT过程中,梯度通过所提出的代理反向传播,而非通过STE估计,从而实现对模型权重、量化参数和逐层位宽配置的基于梯度的优化。在CIFAR-10上的实验表明,在不同位宽设置下,我们的方法比几种代表性量化近似方法获得更高的精度。在嵌入式平台上,对于检测和分割任务,它比工业量化框架(如TensorRT和华为AMCT)的量化后精度提升最高达3.66个百分点,并比代表性位宽分配方法高出最高7.49个百分点。这些结果证明了所提方法在资源受限设备上提高量化神经网络精度的有效性。
Keyword:
non-differentiability
rounding operation
gradient estimation
bit-width allocation
sensitivity

