返回
摘要
En 中文
近期存储技术的进步促进了分层存储系统在数据密集型计算集群中的广泛应用。例如,Hadoop分布式文件系统(HDFS)现支持将数据存储在内存、SSD和HDD中,而OctopusFS和hatS则提供了细粒度的存储分层解决方案。然而,大数据平台(如Hadoop和Spark)的任务调度器仅根据数据本地性信息将任务分配给可用资源,完全忽略了本地数据现存储于具有不同性能特征的多种存储介质上的事实。本文提出了一种名为Trident的规范化的任务调度方法,该方法旨在基于数据本地性和存储分层信息做出最优的任务分配决策。Trident将任务调度表述为二分图中的最小成本最大匹配问题,并使用标准求解器寻找最优解。此外,Trident利用两种新颖的剪枝算法来限制图的大小,同时仍保证最优性。Trident已在Spark和Hadoop中实现,并通过基于Facebook跟踪数据的真实工作负载以及经过行业验证的基准进行了广泛评估,结果表明其在应用性能和集群效率方面带来了显著收益。
期刊
暂无期刊信息
机构
暂无机构信息
引用论文
暂无论文信息

