返回
SampleLLM: Prune LLMs via learnable structure sampling
DOI:10.1016/j.neucom.2026.134215.png)
摘要
En 中文
随着大型语言模型(LLMs)的规模持续增长,降低计算开销的需求日益增加。结构化剪枝已被证明是模型压缩的有效技术。然而,现有方法常受限于对人工定义的启发式指标的依赖以及碎片化的“剪枝-再训练”流程,该流程忽略了不同剪枝结构之间的相关性。为解决这些不足,我们引入了SampleLLM,将剪枝表述为一个可学习的采样过程。通过联合优化采样参数和LoRA权重,SampleLLM能够捕捉剪枝结构重要性的动态变化,并消除了对人工剪枝指标的需求。我们还引入了自蒸馏机制,以进一步使剪枝后的模型与其密集版本对齐。在5个系列共9个模型上的广泛实验表明,SampleLLM优于现有的结构化剪枝方法。例如,我们剪枝40%的LLaMA2-70B模型保留了其98%的原始性能。此外,在相同的压缩率下,它相比2:4半结构化剪枝方案实现了更优的性能和推理加速。

