返回
Cornucopia: Elastic GPU cluster management for mixed batch-interactive distributed training
DOI:10.1016/j.jpdc.2026.105334.png)
摘要
En 中文
快速训练深度学习(DL)模型的能力在加速模型设计过程中起着重要作用。DL实践者通常需要在设计新模型或调试现有模型时提交试错作业;一旦确定了模型架构和超参数,实践者将训练这些模型至收敛以进行推理部署。因此,这些试错作业通常需要具有交互性,因为DL实践者正在积极进行模型设计。然而,现有的GPU集群管理器通常假设训练作业是批处理导向的,导致交互式训练作业的排队时间非常长。为了满足混合的交互式和批处理训练工作负载,同时优化排队时间和作业完成时间(JCT),我们设计了一个名为Cornucopia的新集群管理器。我们利用了一种名为弹性训练的新特性,允许作业被部分抢占以释放GPU资源供高优先级作业开始执行。具体来说,Cornucopia由三个主要组件组成:一个根据优先级确定作业队列的调度器、一个评估作业资源加速比的分析器,以及一个负责资源分配和抢占决策的分配器。通过大规模基于轨迹的模拟,我们表明,与几个最近的GPU调度器相比,Cornucopia将交互式作业的排队时间最多减少了90%,同时确保了JCT。
Keyword:
Distributed training
GPU cluster
Elastic training
Job scheduling
期刊
IF:
4
论文数:
3.8K
被引数:
4.8K
机构
引用论文
暂无论文信息

