arrow
返回

Compiler-based loop unrolling optimization for dual-SIMD extensions

delete2026-03-07
delete0
PRE
AI
J
Jinyang Yao
L
Lili Liu
X
Xuanyu Fu
W
Wenbo Liu
C
Chaowei Zhao
W
Wei Wu *
Z
Zheng Shan *
DOI:10.1007/s11227-026-08404-wdelete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
单指令多数据(SIMD)扩展在加速高性能计算(HPC)和人工智能(AI)工作负载的计算方面发挥着关键作用。为充分利用这些架构,本研究引入了一种基于编译器的方法,通过可向量化循环展开为配备双-SIMD扩展的处理器生成并行代码。所提出的优化在GNU编译器集合(GCC)和SWGCC710编译器中作为可选的编译过程实现,可通过单一标志激活。在神威和英特尔处理器上进行的性能评估——使用SPEC CPU 2006、SPEC CPU 2017和NAS并行基准(NPB)——证明了所提出方法的有效性。与常规-O3优化级别相比,该技术实现了全应用1.031的几何平均加速比,最高达1.165,而在神威平台上内核循环达到1.168。在英特尔系统上进行的实验进一步证实了该优化的可移植性及其在不同架构上的一致性能提升。
Keyword:
Compiler optimization
Loop unrolling
Dual-SIMD extensions
Pipelining
Autovectorization

期刊

T
The Journal of Supercomputing
IF:
0
论文数:
647
被引数:
0

机构

Z
zhengzhou university
学者数:
1.3W
论文数: 3.5K
被引数: 2
I
Information Engineering University
学者数:
484
论文数: 161
被引数: 0
学者 查看更多机构
引用论文

引用论文

err分享
err收藏
ALBUS: A method for efficiently processing SpMV using SIMD and Load balancing
err2021-03-01
err20
PREAI
errBian, Haodong; Huang, Jianqiang; Liu, Lingbin; Huang, Dongqiang; Wang, Xiaoying
err分享
err收藏
Partial control-flow linearization
err2018-06-11
err0
PREAI
errSimon Moll; Sebastian Hack
err分享
err收藏
The ARM Scalable Vector Extension
err2017-03-01
err0
errOAAI
errNigel Stephens; Stuart Biles; Matthias Boettcher; Jacob Eapen; Mbou Eyole; Giacomo Gabrielli; Matt Horsnell; Grigorios Magklis; Alejandro Martinez; Nathanael Premillieu; Alastair Reid; Alejandro Rico; Paul Walker
err分享
err收藏
The Nas Parallel Benchmarks
err1991-09-01
err0
PREAI
errD.H. Bailey; E. Barszcz; J.T. Barton; D.S. Browning; R.L. Carter; L. Dagum; R.A. Fatoohi; P.O. Frederickson; T.A. Lasinski; R.S. Schreiber; H.D. Simon; V. Venkatakrishnan; S.K. Weeratunga
err分享
err收藏
没有更多内容