arrow
返回

A Learned Performance Model With Transfer Learning Across GPUs on Tensorized Instructions

delete2025-09-01
delete0
PRE
AI
Y
Yang Bai
M
Mingjun Li
W
Wendong Xu
B
Bei Yu
DOI:10.1109/TPDS.2025.3578630delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
训练和推理效率日益增大的深度神经网络的性能高度依赖于特定硬件加速器上张量操作的性能。因此,具有张量化指令编译的自动张量生成性能调优框架对于高效部署是必要的。这些新颖的张量化指令,以及新兴的机器学习模型,为基于编译的方法带来了巨大的工程挑战。它们在探索巨大的设计空间时面临精度粗糙的测量和特定硬件约束下专门指令间差劲的转移能力。本文提出了一种用于张量化指令自动代码优化的新型性能模型。该性能模型的核心是分配特征,它不仅通过计算和数据移动抽象清晰地指定了指令的行为,还正式定义了从算法到张量化指令的匹配问题。同时,一个简单而高效的基于注意力启发模块的设计,通过捕获完整调度空间内的全局和长距离依赖关系,来精确预测优化后张量程序的性能。与最先进技术相比,我们的性能模型能够预测具有张量化指令代码配置的最优实现,以在现代DNN基准测试中将推理延迟和搜索时间最多减少1.21倍和3.41倍。此外,通过预训练参数,我们的性能能够通过迁移学习快速适应不同工作负载和平台上的张量化指令。
Keyword:
Attention
code generation
compiler
performance model
tensorized instructions

期刊

IEEE Transactions on Parallel and Distributed Systems 封面图
IEEE Transactions on Parallel and Distributed Systems
IF:
6
论文数:
5.2K
被引数:
1.1W

机构

T
The Chinese University of Hong Kong
学者数:
3.8K
论文数: 1.9K
被引数: 3
T
The University of Hong Kong
学者数:
6.6K
论文数: 3.2K
被引数: 7
引用论文

引用论文

In-Datacenter Performance Analysis of a Tensor Processing Unit
err2017-06-24
err0
errOAAI
errNorman P. Jouppi; Cliff Young; Nishant Patil; David Patterson; Gaurav Agrawal; Raminder Bajwa; Sarah Bates; Suresh Bhatia; Nan Boden; Al Borchers; Rick Boyle; Pierre-luc Cantin; Clifford Chao; Chris Clark; Jeremy Coriell; Mike Daley; Matt Dau; Jeffrey Dean; Ben Gelb; Tara Vazir Ghaemmaghami; Rajendra Gottipati; William Gulland; Robert Hagmann; C. Richard Ho; Doug Hogberg; John Hu; Robert Hundt; Dan Hurt; Julian Ibarz; Aaron Jaffey; Alek Jaworski; Alexander Kaplan; Harshit Khaitan; Daniel Killebrew; Andy Koch; Naveen Kumar; Steve Lacy; James Laudon; James Law; Diemthu Le; Chris Leary; Zhuyuan Liu; Kyle Lucke; Alan Lundin; Gordon MacKean; Adriana Maggiore; Maire Mahony; Kieran Miller; Rahul Nagarajan; Ravi Narayanaswami; Ray Ni; Kathy Nix; Thomas Norrie; Mark Omernick; Narayana Penukonda; Andy Phelps; Jonathan Ross; Matt Ross; Amir Salek; Emad Samadiani; Chris Severn; Gregory Sizikov; Matthew Snelham; Jed Souter; Dan Steinberg; Andy Swing; Mercedes Tan; Gregory Thorson; Bo Tian; Horia Toma; Erick Tuttle; Vijay Vasudevan; Richard Walter; Walter Wang; Eric Wilcox; Doe Hyun Yoon
err分享
err收藏
FBNet: Hardware-Aware Efficient ConvNet Design via Differentiable Neural Architecture Search
err2019-06-01
err0
errOAAI
errBichen Wu; Kurt Keutzer; Xiaoliang Dai; Peizhao Zhang; Yanghan Wang; Fei Sun; Yiming Wu; Yuandong Tian; Peter Vajda; Yangqing Jia
err分享
err收藏
TensorIR: An Abstraction for Automatic Tensorized Program Optimization
err2023-01-30
err0
errOAAI
errSiyuan Feng; Bohan Hou; Hongyi Jin; Wuwei Lin; Junru Shao; Ruihang Lai; Zihao Ye; Lianmin Zheng; Cody Hao Yu; Yong Yu; Tianqi Chen
err分享
err收藏
UHRSNet: A Semantic Segmentation Network Specifically for Ultra-High-Resolution Images
err2021-01-10
err0
PREAI
errLianlei Shan; Minglong Li; Xiaobin Li; Yang Bai; Ke Lv; Bin Luo; Si-Bao Chen; Weiqiang Wang
err分享
err收藏
GTuner
err2022-08-23
err0
PREAI
errQi Sun; Xinyun Zhang; Hao Geng; Yuxuan Zhao; Yang Bai; Haisheng Zheng; Bei Yu
err分享
err收藏
GTCO: Graph and Tensor Co-Design for Transformer-Based Image Recognition on Tensor Cores
err
IF0
err2024-02-01
err0
PREAI
errYang Bai; Xufeng Yao; Qi Sun; Wenqian Zhao; Shixin Chen; Zixiao Wang; Bei Yu
err分享
err收藏
Scene Text Visual Question Answering
err2019-10-01
err0
errOAAI
errAli Furkan Biten; Ruben Tito; Andres Mafla; Lluis Gomez; Marcal Rusinol; C.V. Jawahar; Ernest Valveny; Dimosthenis Karatzas
err分享
err收藏
The tensor algebra compiler张量代数编译器
err2017-10-12
err0
errOAAI
errFredrik Kjolstad; Shoaib Kamil; Stephen Chou; David Lugato; Saman Amarasinghe
err分享
err收藏
学者 查看更多内容