arrow
返回

CloudX: A dual-layered cloud native architecture for GPU resource management using interactive notebook

delete2026-06-01
delete0
PRE
AI
A
Ary Mazharuddin Shiddiqi *
R
Royyana Muslim Ijtihadie
K
Kale, Timothy Girry
R
Rizky Januar Akbar
N
Navastara, Dini Adni
F
Fahriani, Nuniek
P
Pepuho, Gloriyano Cristho Daniel
A
Aptanagi, Urdhanaka
N
Ntivuguruzwa Jean De La Croix
DOI:10.1016/j.array.2026.101026delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本研究提出CloudX,一个集成基于Docker的容器配置与嵌入式GPU感知调度器的两层框架,该调度器嵌入在Jupyter Enterprise Gateway (JEG)中,并采用加权多资源调度策略动态分配交互式笔记本会话。它通过一个轻量级服务发现层扩展了JupyterHub和JupyterLab,该层实时监控CPU、RAM和GPU遥测数据。实验在一个包含3个GPU启用(NVIDIA RTX A4000)和4个非GPU工作节点的8节点异构集群上进行,使用四种工作负载类型:GPU密集型训练(W1)、内存带宽受限推理(W2)、基于CPU的预处理(W3)以及混合异构会话(W4)。基线比较采用轮询(RR)、最少连接(LC)和DRF-GPU(一种多资源感知调度器)。评估显示CloudX能够在不到六分钟内配置新容量,提高平均GPU利用率25%-40%,减少工期18%-23%,并在1.5到20个并发GPU会话时保持高效的Efflb负载均衡,同时始终将启动延迟保持在五秒以下。在Jain公平性指数(JFI)上,CloudX得分为0.996,与DRF-GPU持平,高于LC(0.981)和RR(0.956),表明在所有集群节点上实现了工作负载分布和GPU利用率的平衡。从尾部延迟角度看,CloudX在峰值负载20个并发会话下保持P95和P99启动延迟为4.7秒,低于5秒的交互性阈值。同时,CloudX的P99工期为309.6秒,而RR为411.9秒。总体而言,CloudX在基于云的AI环境中对多租户GPU共享是高效的。
Keyword:
Cloud-native architecture
GPU-aware scheduling
Container provisioning
Jupyter Enterprise Gateway (JEG)
Resource utilisation efficiency

期刊

Array 封面图
Array
IF:
4.5
论文数:
934
被引数:
1.2K

机构

I
institut teknologi sepuluh nopember
学者数:
186
论文数: 49
被引数: 0
引用论文

引用论文

暂无论文信息