返回
Compiler-based loop unrolling optimization for dual-SIMD extensions
DOI:10.1007/s11227-026-08404-w.png)
摘要
En 中文
单指令多数据(SIMD)扩展在加速高性能计算(HPC)和人工智能(AI)工作负载的计算方面发挥着关键作用。为充分利用这些架构,本研究引入了一种基于编译器的方法,通过可向量化循环展开为配备双-SIMD扩展的处理器生成并行代码。所提出的优化在GNU编译器集合(GCC)和SWGCC710编译器中作为可选的编译过程实现,可通过单一标志激活。在神威和英特尔处理器上进行的性能评估——使用SPEC CPU 2006、SPEC CPU 2017和NAS并行基准(NPB)——证明了所提出方法的有效性。与常规-O3优化级别相比,该技术实现了全应用1.031的几何平均加速比,最高达1.165,而在神威平台上内核循环达到1.168。在英特尔系统上进行的实验进一步证实了该优化的可移植性及其在不同架构上的一致性能提升。
Keyword:
Compiler optimization
Loop unrolling
Dual-SIMD extensions
Pipelining
Autovectorization
期刊
T
IF:
0
论文数:
647
被引数:
0
机构
引用论文
没有更多内容

