返回
Efficient Quantization of Pretrained Deep Networks via Adaptive Block Transform Coding
DOI:10.3390/info17010069.png)
摘要
En 中文
本研究探讨了块变换编码(BTC)作为一种轻量级、无需训练的量化策略,用于压缩预训练深度神经网络的权重。所提出的方法采用基于规则的块变换,并使用方差和均方根误差(RMSE)驱动的停止准则,能够在显著降低比特精度的同时保留卷积层和全连接层权重的统计结构。与均匀8位量化不同,BTC能够跨层动态调整比特使用,并在相同的压缩预算下实现显著更低的失真。我们在多种预训练架构和表格基准上评估了BTC。实验结果表明,BTC可将每权重的存储量稳定减少至4-7.7位,同时保持与32位浮点(FP32)基线相差2-3%的精度。为进一步评估可扩展性和基线强度,BTC还在大规模ImageNet模型上进行了评估,并与校准的基于百分位的均匀训练后量化方法进行了比较。结果显示,BTC在仅引起小幅精度下降的情况下实现了显著更低的实际比特宽度,较校准感知的8位量化表现出有利的压缩-精度权衡。BTC还表现出在连续训练后量化(PTQ)配置中的稳定行为、低量化噪声和平滑的RMSE趋势,在激进压缩下优于简单的均匀量化。这些发现证实,BTC提供了一种可扩展、架构无关且无需训练的量化机制,适用于内存和计算受限的环境。
Keyword:
block transform coding
quantization
neural networks
model compression
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
I
IF:
2.9
论文数:
861
被引数:
9.8K

