返回
SMIT: Static mixed integer training quantization
DOI:10.1007/s11227-026-08857-z.png)
摘要
En 中文
深度神经网络(DNNs)在视觉任务中取得了显著成功,但其在训练过程中的大规模部署引入了巨大的计算和能耗需求。低精度量化为提高效率提供了有前景的途径;然而,现有的亚8位训练技术常遇到不稳定性和显著的精度下降,限制了其实用性。本研究提出了一种静态混合整数训练(SMIT)方法,这是一种用于端到端DNN训练的经验框架,采用固定的、异构位宽对权重、激活值和梯度进行量化。SMIT的动机源于经验观察,即不同的训练组件对量化噪声的敏感性不同。通过系统性的设计空间探索,我们确定了一种经验上有效的配置W4/A6/E8(4位权重、6位激活值和8位梯度),该配置在数值稳定性和降低精度之间提供了有利的权衡。在包括ImageNet分类、目标检测(Cityscapes)和语义分割(Pascal VOC)在内的多个视觉任务上的实验结果表明,SMIT始终能在FP32性能的1.0%~2%范围内实现精度。这些结果证明了静态异构亚8位训练的实用性,同时避免了运行时精度调度或特定架构的调整。除了数值稳定性之外,所提出的静态精度分配可能通过避免运行时精度自适应,简化未来低精度高性能计算的实现,并为未来的低精度加速器和分布式AI系统提供硬件友好的框架。
Keyword:
Quantization
Deep neural networks (DNN)
Mixed-Integer
期刊
IF:
2.7
论文数:
1.1K
被引数:
1.0W
机构
暂无机构信息
引用论文
Training high-performance and large-scale deep neural networks with full 8-bit integers使用完整的8位整数训练高性能和大规模的深度神经网络
NEURAL NETWORKS
IF6.3
AWQ: Activation-aware Weight Quantization for On-Device LLM Compression and AccelerationAWQ:基于激活感知的权重量化方法,用于设备端大语言模型(LLM)的压缩与加速
没有更多内容

