返回
Optimizing resource allocation for geographically-distributed inference by large language models
DOI:10.1016/j.peva.2025.102527.png)
摘要
En 中文
大型语言模型(LLMs)在许多人工智能(AI)任务中表现出卓越的性能,但由于需要高端GPU,即使在训练后使用成本依然高昂。最近,开发了一种名为PETALS的分布式系统,通过将模型块分布在互联网上多台配备低端GPU的服务器上,降低了LLMs部署的门槛,其速度远快于在GPU内存与其他更便宜但更慢的本地存储介质之间交换模型参数。然而,此类分布式系统的性能严重依赖于资源分配,而如何进行最优分配尚不明确。本研究首次系统性地研究了分布式LLMs推理中的资源分配问题,重点关注两个重要决策:块放置和请求路由。主要成果包括:(i) 经实验验证的性能模型,可预测在给定块放置和请求路由决策下的推理性能;(ii) 将离线块放置和请求路由的优化表述为混合整数线性规划(MILP)问题,并提供了NP难度的证明以及具有保证性能的多项式复杂度算法;(iii) 针对有界负载的在线场景,对离线算法进行了适配,并保持相同的性能保证。通过实验和经实验验证的仿真,我们验证了所提解决方案在地理分布服务器等多样化场景下,相比当前最佳方案可显著减少推理时间。作为副产品,我们还开发了一个轻量级仅CPU仿真器,能够预测分布式LLMs在GPU服务器上的性能,可用于评估大规模部署,并为GPU访问受限的研究人员促进未来研究。
Keyword:
Large language model
Model parallelism
Block placement
Request routing
期刊
P
IF:
0.8
论文数:
38
被引数:
851
机构
引用论文
Joint Optimization of Service Function Placement and Flow Distribution for Service Function Chaining

