arrow
返回

Towards Generic Failure-Prediction Models in Large-Scale Distributed Computing Systems

delete2025-08-29
delete0
delete
OA
AI
S
Srigoutam Jagannathan
Y
Yogesh Sharma
T
Taheri, Javid *
DOI:10.3390/electronics14173386delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
分布式计算(DC)系统日益增长的复杂性需要先进的故障预测模型来提升可靠性和效率。本研究提出了一种全面的方法论,用于开发能够实现跨层和跨平台故障预测的通用机器学习(ML)模型,且无需进行平台特定的再训练。我们使用来自故障跟踪档案(FTA)的Grid5000故障数据集,探索了线性回归、逻辑回归、随机森林和XGBoost等方法,以预测三个关键指标:故障间隔时间(TBF)、恢复/修复时间(TTR)和故障节点识别(FNI)。我们的方法包括广泛的探索性数据分析(EDA)、故障模式的统计检验以及模型在集群、站点和系统层面的评估。结果表明,XGBoost始终优于其他模型,在TBF和FNI上实现了接近完美的100%准确率,并在多样化的DC环境中表现出良好的泛化能力。此外,我们引入了一种分层DC架构,整合了这些故障预测模型。以用例的形式,我们还展示了服务提供商如何利用这些预测模型来平衡服务可靠性和成本。
Keyword:
failure prediction
machine learning
distributed computing
XGBoost
cross-platform modeling

期刊

Electronics 封面图
Electronics
IF:
2.6
论文数:
9.9K
被引数:
4.7W

机构

U
University of Regina
学者数:
3.0K
论文数: 3.2K
被引数: 3.9K
引用论文

引用论文

err分享
err收藏
err分享
err收藏
err分享
err收藏
学者 查看更多内容