返回
Mapo: Performance model driven GPU memory access code optimization
DOI:10.1016/j.future.2026.108606.png)
摘要
En 中文
• 我们提出Mapo-PM,一种针对GPU程序的多模态内存访问性能建模方法。它结合静态程序分析与动态性能分析,从源代码、编译器中间表示、程序结构和运行时内存访问行为中提取多模态特征。这些特征通过跨模态融合(CMF)机制统一,用于预测内存访问性能指标。在推理阶段,Mapo-PM仅依赖静态源代码、输入规模和线程块配置,显著降低对运行时性能分析的依赖。
• 我们设计了PM2RL,一种基于强化学习(RL)驱动的、面向内存的代码优化机制。通过深度耦合微调后的LLM与Mapo-PM,并利用性能模型的预测结果构建奖励信号,PM2RL引导LLM在迭代优化过程中探索并生成具有改进内存访问特性的代码,从而减少频繁编译和运行时性能评估的额外开销。
• 我们构建了多模态GPU内存访问性能与代码优化数据集,涵盖多样化的程序结构、输入规模和优化策略。这些数据集为Mapo-PM的训练与评估以及LLM的微调提供了必要支持。
• 我们在多个GPU平台上对代表性基准程序和实际应用进行了广泛的实验评估。结果表明,Mapo在内存访问性能模型准确性和代码优化有效性方面具有优势。
Keyword:
GPU memory access
performance modeling
code optimization
multimodal features
reinforcement learning

