返回
摘要
En 中文
随着科学和工程挑战在复杂性和规模上的增长,对稀疏矩阵计算有效解决方案的需求日益关键。LU分解因其能够减少计算负载并增强数值稳定性而成为一种有前景的方法。本研究专注于加速电路仿真中的稀疏LU分解,以解决由大型电路矩阵引起的仿真时间延长问题。我们提出了一种基于操作优化的LU(OOLU)分解架构,显著提高了电路分析效率。OOLU采用类似VLIW的处理单元阵列,并引入一个调度器,将计算分解为细粒度的操作任务流图,以最大化操作间的并行性。采用专门的调度和数据映射策略,以适应可配置的流水线框架和电路矩阵的特性。OOLU架构在FPGA上实现原型,并通过在佛罗里达大学稀疏矩阵集合上的广泛测试进行验证,与多个平台进行基准测试。该加速器相较于KLU软件包实现了3.48×至32.25×(平均12.51×)的加速比。此外,相较于先前的FPGA加速器,平均加速比为2.64×,相较于GPU加速器STRUMPACK和SFLU,分别实现了25.18×和32.27×的加速比,凸显了该方法带来的显著效率提升。
Keyword:
Sparse matrix
LU decomposition
parallel processing
hardware acceleration
circuit simulation
FPGA

