返回
Arch-Net: Model conversion and quantization for architecture agnostic model deployment
DOI:10.1016/j.neunet.2025.107384.png)
摘要
En 中文
深度神经网络(DNNs)的显著计算需求为其实际应用带来了重大挑战。最近,许多专用集成电路(ASIC)芯片已集成用于神经网络加速的专用硬件支持。然而,ASIC芯片漫长的开发周期意味着它们通常落后于神经网络架构研究的最新进展。例如,层归一化(Layer Normalization)在许多流行芯片上支持不佳,且7×7卷积的效率显著低于等效的三个3×3卷积。因此,在本文中,我们介绍了Arch-Net,一种仅由少数几种常见算子组成的神经网络框架,具体包括3×3卷积、2×2最大池化、批归一化(Batch Normalization)、全连接层和拼接操作,这些算子在大多数ASIC架构中均得到高效支持。为促进不同网络架构向Arch-Net的转换,我们提出了Arch-Distillation方法,该方法整合了残差特征适配(Residual Feature Adaptation)和教师注意力机制(Teacher Attention Mechanism)等策略。这些机制实现了不同网络结构间的高效转换,并支持模型量化。所得的Arch-Net消除了非标准网络结构,同时在低于8位量化条件下仍能保持稳健性能,从而提升了兼容性和部署效率。图像分类和机器翻译任务的经验结果表明,仅使用少数几种算子的Arch-Net能够达到与复杂架构相当的效果。这为在各类ASIC芯片上部署结构无关的神经网络提供了新的见解。
Keyword:
Neural networks
Knowledge distillation
Model quantization
ASIC chips
Model deployment
期刊
IF:
6.3
论文数:
8.2K
被引数:
3.0W
机构
暂无机构信息

