arrow
返回

Memory-efficient neural network training via gradient compression through continuous basis tracking

delete2026-03-07
delete0
PRE
AI
N
null Meng
M
Muhammad A.A. Abdelgawad
P
Peng Jing
R
Ray C.C. CHEUNG
H
Hong Yan
DOI:10.1016/j.neucom.2026.133278delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大型语言模型(LLMs)在广泛任务上取得了前所未有的成功,但其训练和微调因参数数量庞大及优化器状态繁多而需要巨大的计算资源和内存。尽管近期方法GaLore利用低秩梯度投影来降低内存消耗,但受限于表达能力不足或计算开销过高,这主要源于频繁的全秩奇异值分解(SVD)。本研究提出InGaLore,一种新颖的内存和时间高效的神经网络训练框架,通过引入截断增量SVD来持续更新梯度投影基。该方法追踪梯度的演化子空间,实现了低秩梯度的高效压缩并降低计算成本。我们进一步分析了投影矩阵更新过程中出现的损失峰值现象,提供了新的解释及有效的缓解策略。在LLMs的预训练和微调任务上的实验表明,InGaLore与ERInGaLore在保持低内存占用的同时,将现有方法的时钟时间缩短了15%,且在模型规模扩大时,本方法带来的时钟时间节省效应更为显著。
Keyword:
gradient compression
low-rank approximation
incremental SVD
neural network training
memory efficiency

期刊

Neurocomputing 封面图
Neurocomputing
IF:
6.5
论文数:
2.5W
被引数:
6.5W

机构

暂无机构信息
引用论文

引用论文

暂无论文信息