arrow
返回

Graph-based clustering cost model for performance optimization in deep learning compilers

delete2026-06-19
delete0
PRE
AI
C
Chaoyao Shen
Y
Yixian Shen
T
Tao Xu
B
Bohan Guo
L
Linfeng Jiang
M
Meng Zhang *
A
Anuj Pathania
A
Andy D. Pimentel
DOI:10.1016/j.sysarc.2026.103895delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
深度学习(DL)编译器通过利用成本模型进行高效的张量程序优化,实现了深度神经网络(DNNs)在多样化硬件平台上的自动化部署。这些系统的有效性取决于离线训练成本模型的预测精度和跨模型泛化能力。现有方法主要关注特征工程和成本模型架构设计,而很大程度上忽视了计算子图级别的结构相似性,这限制了预测性能的进一步提升。为解决此限制,我们提出了一种基于图自动编码器的无监督子图聚类框架,以增强离线训练的成本模型。具体而言,DL模型被划分为计算子图,并提取节点特征。图自动编码器学习这些子图的高维结构嵌入,随后通过K均值聚类将结构相似的模式分组。为不同的子图簇训练专用的成本模型以预测张量程序性能。这种细粒度、集群感知的训练策略提高了预测精度和泛化能力,从而增强了自动调优效率。在多个DL模型上的实验结果表明,该方法在CPU和GPU平台上均显著提升了搜索效率和应用延迟优化。与Tenset相比,我们的方法实现了平均搜索速度提升9.46倍和5.15倍,同时带来1.18倍和1.07倍的延迟改进。

期刊

Journal of Systems Architecture 封面图
Journal of Systems Architecture
IF:
4.1
论文数:
3.0K
被引数:
4.2K

机构

U
university of amsterdam
学者数:
6.0W
论文数: 5.1W
被引数: 94
S
Southeast University
学者数:
2.1W
论文数: 8.6K
被引数: 480
引用论文

引用论文

暂无论文信息