arrow
返回

Cornucopia: Elastic GPU cluster management for mixed batch-interactive distributed training

delete2026-07-01
delete0
PRE
AI
H
Huang, Zimeng
李
李石坚 (Shijian Li)
F
Fan, Zihao
B
BoJiang(江波) (Bo Jiang) *
T
Tian Guo *
DOI:10.1016/j.jpdc.2026.105334delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
快速训练深度学习(DL)模型的能力在加速模型设计过程中起着重要作用。DL实践者通常需要在设计新模型或调试现有模型时提交试错作业;一旦确定了模型架构和超参数,实践者将训练这些模型至收敛以进行推理部署。因此,这些试错作业通常需要具有交互性,因为DL实践者正在积极进行模型设计。然而,现有的GPU集群管理器通常假设训练作业是批处理导向的,导致交互式训练作业的排队时间非常长。为了满足混合的交互式和批处理训练工作负载,同时优化排队时间和作业完成时间(JCT),我们设计了一个名为Cornucopia的新集群管理器。我们利用了一种名为弹性训练的新特性,允许作业被部分抢占以释放GPU资源供高优先级作业开始执行。具体来说,Cornucopia由三个主要组件组成:一个根据优先级确定作业队列的调度器、一个评估作业资源加速比的分析器,以及一个负责资源分配和抢占决策的分配器。通过大规模基于轨迹的模拟,我们表明,与几个最近的GPU调度器相比,Cornucopia将交互式作业的排队时间最多减少了90%,同时确保了JCT。
Keyword:
Distributed training
GPU cluster
Elastic training
Job scheduling

期刊

Journal of Parallel and Distributed Computing 封面图
Journal of Parallel and Distributed Computing
IF:
4
论文数:
3.8K
被引数:
4.8K

机构

W
worcester polytechnic institute
学者数:
49
论文数: 23
被引数: 0
S
Shanghai Jiao Tong University
学者数:
5.0K
论文数: 1.5K
被引数: 0
引用论文

引用论文

暂无论文信息