返回
A faster heterogeneous parallel computing method for Tucker decomposition
DOI:10.1016/j.engappai.2025.110725.png)
摘要
En 中文
人工智能(AI)技术在语音识别、语义理解、计算机视觉等应用领域正呈爆炸式发展。特别是新一代知识增强型大语言模型已逐渐成为社会生产力的基础设施。随着大模型向多模态发展,以张量形式表征的输入数据和模型参数正变得日益庞大,这对计算能力和存储能力提出了高要求。Tucker分解通过因子矩阵和一个核张量获得自然张量的最优低秩表示,从而降低大数据和人工智能应用中的存储与计算需求。然而,现有的Tucker分解方法在计算速度和收敛性能上表现有限。本文提出了一种通用的Tucker分解异构计算框架,该框架分析了因子矩阵的行独立性以及Kruskal矩阵的列独立性,并分别以列优先方式更新Kruskal矩阵、以行优先方式更新因子矩阵,以减少计算过程中的存储开销。此外,所提出的方法采用异构计算平台加速计算瓶颈,并充分利用细粒度并行优化技术提高内存访问效率。实验结果表明,其计算速度相比最新方法提升了3.1至75.4倍,且在所有方法中展现出最佳的收敛性能。
Keyword:
Artificial intelligence
Deep learning
Tucker decomposition
Tensor analysis
Heterogeneous computing
Parallel computing
期刊
IF:
8
论文数:
5.7K
被引数:
3.5W
机构
暂无机构信息
引用论文
Efficient Alternating Least Squares Algorithms for Low Multilinear Rank Approximation of Tensors低张量秩近似的高效交替最小二乘算法
Reigning in GPT-4 to Tutor Java Programming Pupils and Students Instead of just Providing Answer Algorithms – a Prototype将GPT-4应用于辅导Java编程的初学者和大学生,而不仅仅是提供答案算法——一个原型

