返回
Fine grain algorithm parallelization on a hybrid control-flow and dataflow processor
DOI:10.1186/s40537-024-01021-5.png)
摘要
En 中文
高性能计算算法的执行时间受多种因素影响,包括算法的可扩展性、处理元素所选用的硬件以及这些元素之间的通信速度。本研究采用一种集成控制流与数据流硬件的混合架构。具体而言,控制流硬件包含多核与多核架构。为数据流程序员提供了指导,使他们能够在开发数据流硬件算法之前,预测采用混合控制流与数据流架构可实现的速度提升程度。此外,介绍了开发的该方法论,为程序员提供了一种结构化方法,用于分解算法并通过利用最合适的架构类型优化每个部分。程序员的前提条件并非需要了解硬件描述语言,但他必须精通估算算法复杂度。本研究代表了十余年来在混合控制流与数据流架构领域的专业积累。它提供了一种详细的方法论,用于将控制流算法分解为适合数据流架构优化的部分以及更适合控制流架构的部分。采用格子玻尔兹曼方法(Lattice-Boltzmann method)作为代表性示例,在控制流与数据流硬件上均进行了实现。对于给定矩阵维度,分解后的格子玻尔兹曼方法在混合架构上的估计总加速倍数,相对于使用控制流与数据流硬件的执行时间,约为两倍。研究发现凸显了采用混合架构的优势,表明即使在传统上针对数据流架构优化的算法中,也具有显著的加速潜力。混合架构的主要优势在于其能够加速仅特定部分适合数据流硬件的算法。
Keyword:
Control-flow architectures
Dataflow architectures
Hybrid architectures
Algorithm parallelization
期刊
IF:
6.4
论文数:
1.5K
被引数:
1.1W
机构
引用论文
Cache Injection: A Novel Technique for Tolerating Memory Latency in Bus-Based SMPs缓存注入:一种用于容忍总线式SMP内存延迟的新型技术
Large self-assembled clathrin lattices spontaneously disassemble without sufficient adaptor proteins大型网格蛋白自组装晶格在没有足够适配器蛋白的情况下会自发解组装。

