返回
A Learned Performance Model With Transfer Learning Across GPUs on Tensorized Instructions
DOI:10.1109/TPDS.2025.3578630.png)
摘要
En 中文
训练和推理效率日益增大的深度神经网络的性能高度依赖于特定硬件加速器上张量操作的性能。因此,具有张量化指令编译的自动张量生成性能调优框架对于高效部署是必要的。这些新颖的张量化指令,以及新兴的机器学习模型,为基于编译的方法带来了巨大的工程挑战。它们在探索巨大的设计空间时面临精度粗糙的测量和特定硬件约束下专门指令间差劲的转移能力。本文提出了一种用于张量化指令自动代码优化的新型性能模型。该性能模型的核心是分配特征,它不仅通过计算和数据移动抽象清晰地指定了指令的行为,还正式定义了从算法到张量化指令的匹配问题。同时,一个简单而高效的基于注意力启发模块的设计,通过捕获完整调度空间内的全局和长距离依赖关系,来精确预测优化后张量程序的性能。与最先进技术相比,我们的性能模型能够预测具有张量化指令代码配置的最优实现,以在现代DNN基准测试中将推理延迟和搜索时间最多减少1.21倍和3.41倍。此外,通过预训练参数,我们的性能能够通过迁移学习快速适应不同工作负载和平台上的张量化指令。
Keyword:
Attention
code generation
compiler
performance model
tensorized instructions
期刊
IF:
6
论文数:
5.2K
被引数:
1.1W

