arrow
返回

A Modular Static Cost Analysis for GPU Warp-Level Parallelism

delete2026-01-01
delete0
PRE
AI
G
Gregory Blike *
H
Hannah Zicarelli
U
Udaya Sathiyamoorthy
J
Julien Lange
T
Tiago Cogumbreiro
DOI:10.1145/3776693delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
图形处理器(GPU)是性能关键应用的首选加速器,但性能优化需要掌握其内存架构与执行模型之间的复杂交互。现有的GPU核静态分析工具要么识别性能问题但不量化成本,要么无法处理线程发散的控制流,导致严重的过度近似。我们提出了首个针对GPU warp级并行的静态关系成本分析,即使在存在线程发散的情况下也能提供精确界限。我们的分析具有通用性和灵活性,因为它在资源度量(非合并访问、存储器冲突)和成本关系(=、<=、>=)上是参数化的。我们为我们的技术建立了可靠性定理,在Rocq中提供了机械化证明,并将我们的理论实现为一个名为Pico的工具。在可重复性实验中,Pico在所有输入中产生了最紧的界限,在10个核上优于当前最先进的RaCUDA工具(提升1.7倍),而RaCUDA产生了4个不正确的界限并在2个核上崩溃。在测量Pico精度的实验中,我们研究了控制流中线程发散对226个核数据集的影响。我们发现,至少75.3%的条件语句和85.4%的循环可以被精确捕获,而无需引入近似。
Keyword:
cost analysis
relational verification
GPU programming

期刊

P
Proceedings of the ACM on Programming Languages-PACMPL
IF:
2.8
论文数:
308
被引数:
4.7K

机构

U
University of Massachusetts Boston
学者数:
2.4K
论文数: 1.9K
被引数: 4.2K
U
university of massachusetts system
学者数:
3.9W
论文数: 3.6W
被引数: 42
引用论文

引用论文

The Design and Implementation of a Verification Technique for GPU Kernels
err2015-05-22
err0
errOAAI
errAdam Betts; Nathan Chong; Alastair F. Donaldson; Jeroen Ketema; Shaz Qadeer; Paul Thomson; John Wickerson
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
Checking Data-Race Freedom of GPU Kernels, Compositionally
err2021-01-01
err0
PREAI
errCogumbreiro,Tiago; Lange,Julien; Rong,Dennis Liew Zhen; Zicarelli,Hannah
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
学者 查看更多内容