返回
Kitsune: Enabling Dataflow Execution on GPUs with Spatial
DOI:10.1145/3777466.png)
摘要
En 中文
当前最先进的深度学习(DL)模型在规模和复杂性上不断增长,许多现代模型的行为异质性也在增加。GPU仍然是DL应用的主导平台,依赖于批量同步执行模型,该模型存在诸多缺点,并且不适合DL应用的图结构。许多工业界和学术界的尝试试图通过采用垂直融合(将多个顺序操作合并为单个内核)来克服这些问题,但这种方法仍未能实现三个尚未开发的机遇:(1)由于流多处理器(SM)的时间多路复用,当只有一个算子执行时,GPU上的许多资源处于空闲状态;(2)通过更智能的片上数据移动降低能耗,从而在供电受限的环境中实现更高性能;(3)无法利用归约维度作为并行性的来源以减轻批处理压力。本文探索了相对未知的领域,回答了以下关键问题:对当前GPU架构进行适度调整是否能够实现高效的数据流执行,从而规避垂直融合的约束,而无需进行全新的架构设计。我们开发了Kitsune——一套用于构建空间流水线的基本构建模块,以在GPU上实现数据流执行,并基于PyTorch Dynamo开发了一个端到端编译器。在5个挑战性应用中,Kitsune可分别提供最高2.8倍和2.2倍的性能提升,以及分别高达99%和45%的片外流量减少(针对推理和训练)。
Keyword:
GPU architecture
spatial pipelining
artificial intelligence
期刊
A
IF:
1.8
论文数:
96
被引数:
1.1K
机构
引用论文
Cerebras Architecture Deep Dive: First Look Inside the Hardware/Software Co-Design for Deep Learning
IEEE Micro
IF0
DeepCuts: a deep learning optimization framework for versatile GPU workloadsDeepCuts:一种用于多样化GPU工作负载的深度学习优化框架

