arrow
返回

Optimizing resource allocation for geographically-distributed inference by large language models

delete2025-11-01
delete0
PRE
AI
T
Tingyang Sun
H
He, Ting *
B
Bo Ji
P
Parimal Parag
DOI:10.1016/j.peva.2025.102527delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大型语言模型(LLMs)在许多人工智能(AI)任务中表现出卓越的性能,但由于需要高端GPU,即使在训练后使用成本依然高昂。最近,开发了一种名为PETALS的分布式系统,通过将模型块分布在互联网上多台配备低端GPU的服务器上,降低了LLMs部署的门槛,其速度远快于在GPU内存与其他更便宜但更慢的本地存储介质之间交换模型参数。然而,此类分布式系统的性能严重依赖于资源分配,而如何进行最优分配尚不明确。本研究首次系统性地研究了分布式LLMs推理中的资源分配问题,重点关注两个重要决策:块放置和请求路由。主要成果包括:(i) 经实验验证的性能模型,可预测在给定块放置和请求路由决策下的推理性能;(ii) 将离线块放置和请求路由的优化表述为混合整数线性规划(MILP)问题,并提供了NP难度的证明以及具有保证性能的多项式复杂度算法;(iii) 针对有界负载的在线场景,对离线算法进行了适配,并保持相同的性能保证。通过实验和经实验验证的仿真,我们验证了所提解决方案在地理分布服务器等多样化场景下,相比当前最佳方案可显著减少推理时间。作为副产品,我们还开发了一个轻量级仅CPU仿真器,能够预测分布式LLMs在GPU服务器上的性能,可用于评估大规模部署,并为GPU访问受限的研究人员促进未来研究。
Keyword:
Large language model
Model parallelism
Block placement
Request routing

期刊

P
Performance Evaluation
IF:
0.8
论文数:
38
被引数:
851

机构

P
pennsylvania state university - university park
学者数:
1.3W
论文数: 1.0W
被引数: 24
P
Pennsylvania State University
学者数:
3.0W
论文数: 2.6W
被引数: 7.2W
P
pennsylvania commonwealth system of higher education (pcshe)
学者数:
12.9W
论文数: 11.7W
被引数: 177
学者 查看更多机构
引用论文

引用论文

err分享
err收藏
Service Function Chaining in Next Generation Networks: State of the Art and Research Challenges
err2017-02-01
err209
PREAI
errMedhat, Ahmed M.; Taleb, Tarik; Elmangoush, Asma; Carella, Giuseppe A.; Covaci, Stefan; Magedanz, Thomas
err分享
err收藏
The Internet Topology Zoo
err2011-10-01
err1.1K
PREAI
errKnight, Simon; Nguyen, Hung X.; Falkner, Nickolas; Bowden, Rhys; Roughan, Matthew
err分享
err收藏
The Easiest Hard Problem
err2002-01-01
err0
PREAI
errBrian Hayes
err分享
err收藏
PipeDream白日梦
err2019-10-27
err0
PREAI
errDeepak Narayanan; Aaron Harlap; Amar Phanishayee; Vivek Seshadri; Nikhil R. Devanur; Gregory R. Ganger; Phillip B. Gibbons; Matei Zaharia
err分享
err收藏
学者 查看更多内容