arrow
返回

NestQuant: Post-Training Integer-Nesting Quantization for On-Device DNN

delete
delete0
PRE
AI
J
Jianhang Xie
C
Chuntao Ding
X
Xiaqing Li
S
Shenyuan Ren
李
李浥东 (Yidong Li)
Z
Zhichao Lu
DOI:10.1109/TMC.2025.3582583delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
在物联网(IoT)设备上部署具有资源适配能力的量化深度神经网络(DNN)模型以提供高质量AI服务,可以利用压缩的优势并满足多场景资源需求。然而,现有的动态/混合精度量化需要重新训练或特殊硬件,而后训练量化(PTQ)在资源适配方面存在两个局限性:(i)当前最先进的PTQ方法仅提供一个固定位宽模型,这使得适应物联网设备的动态资源具有挑战性;(ii)部署具有不同位宽的多个PTQ模型会消耗大量存储资源并产生切换开销。为此,本文引入了一种资源友好的后训练整数嵌套量化方法,即NestQuant,用于物联网设备上的设备端量化模型切换。所提出的NestQuant整合了整数权重分解,按位将量化权重分解为更高位和更低位整型数据类型的权重。它还包含一个分解权重嵌套机制,通过自适应舍入优化高位权重,并将它们嵌套到原始量化权重中。在部署中,我们可以只发送和存储一个NestQuant模型,并通过调入/调出低位权重在完整位/部分位模型之间切换,以适应资源变化并减少消耗。在ImageNet-1 K预训练DNN上的实验结果表明,NestQuant模型在top-1准确率方面能实现高性能,同时在数据传输、存储消耗和切换开销方面均有减少。特别地,具有INT8嵌套INT6的ResNet-101完整位模型和部分位模型的准确率分别达到78.1%和77.9%,与不同位宽的PTQ模型相比,切换开销减少了约78.1%。
Keyword:
Internet of Things devices
deep neural network
post-training quantization

期刊

IEEE Transactions on Mobile Computing 封面图
IEEE Transactions on Mobile Computing
IF:
9.2
论文数:
5.8K
被引数:
1.8W

机构

B
Beijing Normal University
学者数:
3.3W
论文数: 2.7W
被引数: 4.2W
B
Beijing Jiaotong University
学者数:
2.2W
论文数: 1.7W
被引数: 1.2W
C
City University of Hong Kong
学者数:
2.3W
论文数: 3.0W
被引数: 6.1W
学者 查看更多机构
引用论文

引用论文

暂无论文信息