arrow
返回

Lightweight and Post-Training Structured Pruning for On-Device Large Language Models

delete2025-11-06
delete0
PRE
AI
Z
Z. J. Xu
Y
Yang Xu
徐
徐宏力 (Hongli Xu)
Y
Yunming Liao
Z
Zhiwei Yao
Z
Z. P. Xie
DOI:10.1109/TMC.2025.3629756delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
考虑到硬件友好特性,结构化剪枝已作为一种有效方案出现,用于减少大型语言模型(LLMs)在资源受限设备上的资源需求。由于剪枝一定数量的参数通常会降低模型精度,因此通常需要进行微调以恢复性能损失。然而,微调依赖于高设备算力和大量数据,使其不适合在设备端应用。近期的方法提出了无需微调的后训练结构化剪枝技术,遵循三种粒度,即神经元、注意力头和层。不幸的是,先前的解决方案仍然存在不同粒度下子结构重要性评估的高内存开销问题,以及仅适用于特定结构模型的问题,这限制了它们的应用范围。本文提出COMP,一种轻量级且通用的面向设备端应用的后训练结构化混合粒度剪枝方法。COMP首先使用分布距离和矩阵条件数分别评估模型层和神经元的重要性。随后,COMP执行细粒度神经元剪枝,并通过比较两种粒度策略的结果,同时决定是否应用粗粒度层剪枝。此外,COMP通过掩码微调来恢复模型精度,无需额外微调,最小化对外部数据资源和设备算力的依赖。实验结果表明,COMP在各种架构的模型上表现良好。当剪枝20%的LLaMA-2-13B参数时,COMP仅需不到8 GB的内存,同时保持超过90%的模型精度。同时,COMP相比LLM-Pruner性能提升3.54%,并将内存开销降低90%。
Keyword:
Large language models
matrix condition
post-training pruning
structured pruning

期刊

IEEE Transactions on Mobile Computing 封面图
IEEE Transactions on Mobile Computing
IF:
9.2
论文数:
5.8K
被引数:
1.8W

机构

U
university of science and technology of china
学者数:
1.0W
论文数: 3.9K
被引数: 3
引用论文

引用论文

err分享
err收藏
NVIDIA A100 Tensor Core GPU: Performance and Innovation
err2021-03-01
err0
PREAI
errJack Choquette; Wishwesh Gandhi; Olivier Giroux; Nick Stam; Ronny Krashinsky
err分享
err收藏
LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning
err2024-01-01
err0
PREAI
errMingyang Zhang; Hao Chen; Chunhua Shen; Zhen Yang; Linlin Ou; Xinyi Yu; Bohan Zhuang
err分享
err收藏
An Estimate for the Condition Number of a Matrix
err1979-04-01
err0
PREAI
errA. K. Cline; C. B. Moler; G. W. Stewart; J. H. Wilkinson
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
err分享
err收藏
A Survey on Recent Advances in LLM-Based Multi-turn Dialogue Systems
err2026-04-30
err0
PREAI
errYi,Zihao; Ouyang,Jiarui; Xu,Zhe; Liu,Yuwen; Liao,Tianhao; Luo,Haohao; Shen,Ying
err分享
err收藏
学者 查看更多内容