arrow
返回

A Cost Model for SPARK SQL

delete2019-05-01
delete19
delete
OA
AI
L
Lorenzo Baldacci
DOI:10.1109/TKDE.2018.2850339delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
在本文中,我们提出了一种新的Spark SQL成本模型。成本模型涵盖了广义投影,选择,连接 (GPSJ) 查询的类别。成本模型考虑了网络和IO成本以及最相关的CPU成本。执行成本是从Spark生成的物理计划开始计算的。Spark在执行GPSJ查询时采用的一组操作是基于集群和应用程序参数以及一组数据库统计数据进行分析建模的。在三个基准测试和两个不同大小和不同计算特征的集群上进行的实验结果表明,我们的模型可以估计实际执行时间,平均误差20%。这样的准确性足以让系统选择最有效的计划,即使执行时间差有限。如果将分析模型与我们的straggler处理策略结合在一起,则可以将错误减少到14%。
Keyword:
Spark
Spark SQL
cost model
query optimization
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

IEEE Transactions on Knowledge and Data Engineering 封面图
IEEE Transactions on Knowledge and Data Engineering
IF:
10.4
论文数:
6.8K
被引数:
3.2W

机构

U
University of Bologna
学者数:
4.5W
论文数: 3.8W
被引数: 4.1W
引用论文

引用论文

学者 查看更多内容