返回
GFS: A Preemption-aware Scheduling Framework for GPU Clusters with Predictive Spot Instance Management
DOI:10.1145/3760250.3762231.png)
摘要
En 中文
大型语言模型(LLMs)的激增从根本上重塑了GPU使用模式,迫切需要更高效的管理策略。尽管云服务提供商采用抢占式实例以降低低优先级(LP)任务的成本,但现有调度器仍面临高驱逐率和长排队时间的问题。为解决这些限制,我们提出GFS,一种新颖的抢占式调度框架,该框架在增强高优先级(HP)任务的服务等级目标(SLO)合规性的同时,最小化对LP任务的抢占。首先,GFS利用轻量级预测模型预测不同租户间的GPU需求,实现主动资源管理。其次,GFS采用动态分配机制调整具有保证持续时间的LP任务的抢占式配额。最后,GFS引入抢占式调度策略,优先处理HP任务同时最小化对LP任务的影响。我们通过实际部署和模拟验证了GFS的有效性。结果表明,GFS将驱逐率降低33.0%,并将LP任务的排队延迟减少44.1%。此外,在真实生产集群中,GFS将GPU分配率提高了高达22.8%。在一个超过10,000个GPU的生产集群中,GFS每月可带来约459,715美元的收益。
Keyword:
Spot instance
forecasting model
preemptive scheduling
期刊
机构
引用论文
Mixed integer linear programming in process scheduling: Modeling, algorithms, and applications进程调度中的混合整数线性规划: 建模,算法和应用
DeepWeave: Accelerating Job Completion Time with Deep Reinforcement Learning-based Coflow Scheduling

