arrow
返回

Mapo: Performance model driven GPU memory access code optimization

delete2026-05-23
delete0
PRE
AI
S
Shuai Liu
X
Xiaoshe Dong
J
Junkai Cao
R
Ruifan Chu
Z
Ziheng Wang
Q
Qiang Wang
白秀秀 封面图
白秀秀 (Xiuxiu Bai) *
DOI:10.1016/j.future.2026.108606delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• 我们提出Mapo-PM,一种针对GPU程序的多模态内存访问性能建模方法。它结合静态程序分析与动态性能分析,从源代码、编译器中间表示、程序结构和运行时内存访问行为中提取多模态特征。这些特征通过跨模态融合(CMF)机制统一,用于预测内存访问性能指标。在推理阶段,Mapo-PM仅依赖静态源代码、输入规模和线程块配置,显著降低对运行时性能分析的依赖。 • 我们设计了PM2RL,一种基于强化学习(RL)驱动的、面向内存的代码优化机制。通过深度耦合微调后的LLM与Mapo-PM,并利用性能模型的预测结果构建奖励信号,PM2RL引导LLM在迭代优化过程中探索并生成具有改进内存访问特性的代码,从而减少频繁编译和运行时性能评估的额外开销。 • 我们构建了多模态GPU内存访问性能与代码优化数据集,涵盖多样化的程序结构、输入规模和优化策略。这些数据集为Mapo-PM的训练与评估以及LLM的微调提供了必要支持。 • 我们在多个GPU平台上对代表性基准程序和实际应用进行了广泛的实验评估。结果表明,Mapo在内存访问性能模型准确性和代码优化有效性方面具有优势。
Keyword:
GPU memory access
performance modeling
code optimization
multimodal features
reinforcement learning

期刊

F
Future Generation Computer Systems
IF:
0
论文数:
642
被引数:
0

机构

X
xi'an jiaotong university
学者数:
9.3W
论文数: 6.7W
被引数: 75