返回
Randomized tensor decomposition using parallel reconfigurable systems
DOI:10.1007/s11227-025-07049-5.png)
摘要
En 中文
张量分解算法对于提取真实世界中张量数据的潜在变量和揭示隐藏结构至关重要。与传统的确定性张量分解算法不同,随机化方法通过降低内存需求和计算复杂度,提供了更高的效率。本文提出了一种基于现场可编程门阵列(FPGA)的高效硬件架构,采用高层次综合(HLS)实现了随机化张量分解。该架构通过随机投影、幂迭代和基于QR分解的子空间近似,实现多维数据集的低秩近似。该架构利用可重构系统的能力来加速张量计算,包含三个核心单元:(1) 张量乘矩阵链(TTMc),(2) 张量展开单元,和(3) QR分解单元,以实现三阶段算法。实验结果表明,本FPGA设计相较于在Intel i7-9700 CPU上使用软件库Tensor Toolbox实现的成熟张量分解,实现了高达14.56倍的速度提升。对于大小为512×512×512的大输入张量,本设计相较于Nvidia Tesla T4 GPU实现了5.55倍的速度提升。此外,我们利用基于硬件的高阶奇异值分解(HOSVD)加速器应用于两个实际场景:动态视频数据集的背景减除和数据压缩。在这两个应用中,本设计在准确性和计算时间方面均表现出高效率。
Keyword:
High-level synthesis (HLS)
Field programmable gate array (FPGA)
Randomized algorithm
Low-rank tensor computing
High order singular value decomposition (HOSVD)

