返回
NestQuant: Post-Training Integer-Nesting Quantization for On-Device DNN
DOI:10.1109/TMC.2025.3582583.png)
摘要
En 中文
在物联网(IoT)设备上部署具有资源适配能力的量化深度神经网络(DNN)模型以提供高质量AI服务,可以利用压缩的优势并满足多场景资源需求。然而,现有的动态/混合精度量化需要重新训练或特殊硬件,而后训练量化(PTQ)在资源适配方面存在两个局限性:(i)当前最先进的PTQ方法仅提供一个固定位宽模型,这使得适应物联网设备的动态资源具有挑战性;(ii)部署具有不同位宽的多个PTQ模型会消耗大量存储资源并产生切换开销。为此,本文引入了一种资源友好的后训练整数嵌套量化方法,即NestQuant,用于物联网设备上的设备端量化模型切换。所提出的NestQuant整合了整数权重分解,按位将量化权重分解为更高位和更低位整型数据类型的权重。它还包含一个分解权重嵌套机制,通过自适应舍入优化高位权重,并将它们嵌套到原始量化权重中。在部署中,我们可以只发送和存储一个NestQuant模型,并通过调入/调出低位权重在完整位/部分位模型之间切换,以适应资源变化并减少消耗。在ImageNet-1 K预训练DNN上的实验结果表明,NestQuant模型在top-1准确率方面能实现高性能,同时在数据传输、存储消耗和切换开销方面均有减少。特别地,具有INT8嵌套INT6的ResNet-101完整位模型和部分位模型的准确率分别达到78.1%和77.9%,与不同位宽的PTQ模型相比,切换开销减少了约78.1%。
Keyword:
Internet of Things devices
deep neural network
post-training quantization
期刊
IF:
9.2
论文数:
5.8K
被引数:
1.8W
机构
引用论文
暂无论文信息

