返回
Make Large Language Models Efficient: A Review
DOI:10.1109/ACCESS.2025.3605110.png)
摘要
En 中文
大型语言模型(LLMs)在多种自然语言处理任务中取得了显著成功,其中更大规模的架构通常表现出更优的性能。这种扩展行为推动了生成式人工智能领域的激烈竞争,其背后有超过1万亿美元的投资支持,以开发日益复杂的LLMs。这种竞争反过来培育了一个充满活力的生态系统,激励了诸如DeepSeek等新的开源模型的出现,并促使应用开发者利用最先进的LLMs进行实际部署。然而,大型模型的巨大内存和计算需求给中小型组织带来了严峻障碍,导致严重的可扩展性问题。本文全面回顾了通过四类方法提高LLM效率的近期技术:参数中心、架构中心、训练中心和数据中心。为使新入门者更好地理解,本文涵盖了开发与部署LLMs的整个生命周期。因此,本文围绕五个核心任务组织:本地部署的模型压缩、缩短训练时间的加速预训练、基于定制数据的高效微调、资源约束下的优化推理以及简化的数据准备。我们并非关注广泛策略,而是强调针对每个开发阶段进行专门优化的技术。通过在各阶段应用针对性优化,可在不牺牲模型质量的前提下将计算开销降低50%至95%,使LLMs对计算资源有限的研发人员和从业者更加友好。
Keyword:
Fine tuning
large language model
natural language processing
artificial intelligence
期刊
IF:
3.6
论文数:
9.8W
被引数:
29.4W
机构
引用论文
CycleAlign: Iterative Distillation from Black-box LLM to White-box Models for Better Human Alignment

