返回
Target-Aware Neural Network Execution via Compiler-Guided Pruning
DOI:10.1109/TMC.2025.3631673.png)
摘要
En 中文
移动设备为各种目的运行深度学习模型,例如图像分类和语音识别。由于移动设备的资源限制,研究人员专注于使用模型剪枝来构建轻量级深度神经网络(DNN)模型,或通过编译器优化生成高效代码。观察到模型压缩与编译器自调优的直接集成往往无法为目标设备产生最高效的模型。我们提出CPrune,一种面向高效目标感知DNN执行的编译器指导模型剪枝,以支持具有所需目标精度的应用。为解决具有资源或延迟约束的实际部署场景,我们进一步引入RB-CPrune,一种预测性变体,通过使用学习的延迟估计器消除迭代调优。CPrune通过基于编译器调优过程中构建的子图结构信息进行指导剪枝,生成轻量级DNN模型。我们的实验结果表明,与当前最优的TVM自调优相比,CPrune将DNN执行速度提升了最高2.73倍,同时满足精度要求。
Keyword:
Deep neural networks
model pruning
compiler optimization
edge ai
latency estimation
resource-aware inference
predictive pruning
期刊
IF:
9.2
论文数:
5.8K
被引数:
1.8W
机构
引用论文
Machine Learning-Based Malicious Application Detection of Android基于机器学习的Android恶意应用检测
IEEE ACCESS
IF3.6
Taking the Human Out of the Loop: A Review of Bayesian Optimization将人类带出循环: 贝叶斯优化的回顾
PROCEEDINGS OF THE IEEE
IF25.9

