arrow
返回

The Multiserver-Job Stochastic Recurrence Equation for Cloud Computing Performance Evaluation

delete2026-03-01
delete0
PRE
AI
B
Baccelli, Francois *
D
Diletta Olliaro
M
Marsan, Marco ajmone
A
Andrea Marin
DOI:10.1145/3788105delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
云计算数据中心处理高度可变的工作负载:作业资源需求可以从一个或少数几个核心到数千个不等,作业服务时间可以从毫秒到小时或天不等。这种可变性显著限制了基础设施可实现的最大利用率。排队理论通过定义多服务器作业排队模型(MJQM)研究了这些系统,其中存在s个相同的服务器,作业n需要α(n)个服务器中的一段时间σ(n)。α(n)个服务器同时被占用和释放。不幸的是,尽管其公式简单,MJQM仍然难以捉摸。例如,MJQM的稳定性条件仅在特定情况下被推导出来。因此,即使在重负载下应用离散事件模拟(DES)也具有挑战性,因为稳定性无法预先确定。在本文中,我们分析了在FCFS调度下具有一般独立到达过程和服务时间的MJQM,使用随机递归方程(SREs)和遍历理论。从MJQM SRE的定义出发,我们证明了单调性和可分性特性,这使我们能够应用洛伊斯定理的扩展,即单调-可分框架,并正式定义MJQM的稳定性条件。基于这些结果,我们引入并实现了两种算法:第一种用于绘制系统的子完美样本(SPS)的工作负载,第二种根据作业输入流的统计信息估计系统的稳定性条件。SPS算法的性质允许大规模GPU并行化,从而显著提高性能指标估计的效率。稳定性条件估计算法解决了MJQM分析中的一个重要问题。我们还定义了新的指标来捕捉MJQM系统中的同步损失,并展示了如何使用SRE方法高效评估这些指标。最后,我们表明本文提出的方法可以扩展到更复杂的系统,包括资源具有类型的MJQM。
Keyword:
STABILITY
SERVICE
QUEUES

期刊

P
Proceedings of the ACM on Measurement and Analysis of Computing Systems
IF:
2.7
论文数:
45
被引数:
1.0K

机构

I
Inria
学者数:
3.5K
论文数: 2.5K
被引数: 343
U
Universita Ca Foscari Venezia
学者数:
3.4K
论文数: 3.2K
被引数: 6
I
institut polytechnique de paris
学者数:
1.3W
论文数: 1.0W
被引数: 6
学者 查看更多机构
引用论文

引用论文

暂无论文信息