返回
A Spark Optimizer for Adaptive, Fine-Grained Parameter Tuning
DOI:10.14778/3681954.3682021.png)
摘要
En 中文
随着Spark成为常见的大数据分析平台,其日益增长的复杂性使得对众多参数进行自动调优对性能至关重要。我们在Spark参数调优方面的工作主要受到两大近期趋势的驱动:基于运行时统计的Spark自适应查询执行(AQE),以及日益流行的使成本-性能权衡对最终用户至关重要的Spark云部署。本文介绍了我们设计的一种Spark优化器,该优化器在新AQE架构中控制每个查询的所有可调参数以探索其性能优势,同时将调优问题置于理论严谨的多目标优化(MOO)框架中,以更好地适应用户的成本-性能偏好。为此,我们提出了一种新颖的混合编译时/运行时方法,用于对多样化、相关的Spark参数进行多粒度调优,以及一套建模和优化技术,以在MOO框架下解决调优问题,同时满足云使用中1-2秒的严格时间限制。使用TPC-H和TPC-DS基准测试的评估结果表明,我们方法具有卓越的性能:(8)在优先考虑延迟时,在平均求解时间为0.7-0.8秒的情况下,分别实现了TPC-H和TPC-DS 63%和65%的延迟降低,优于最具有竞争力的MOO方法(仅减少18-25%的延迟,求解时间为2.6-15秒);(88)在调整延迟与成本的偏好时,我们的方法优于替代方法的解决方案,展示了其对不同偏好的卓越适应性。
Keyword:
RESOURCE-MANAGEMENT
MAP-REDUCE
SYSTEM

