返回
摘要
En 中文
在本文中,我们提出了一种新的Spark SQL成本模型。成本模型涵盖了广义投影,选择,连接 (GPSJ) 查询的类别。成本模型考虑了网络和IO成本以及最相关的CPU成本。执行成本是从Spark生成的物理计划开始计算的。Spark在执行GPSJ查询时采用的一组操作是基于集群和应用程序参数以及一组数据库统计数据进行分析建模的。在三个基准测试和两个不同大小和不同计算特征的集群上进行的实验结果表明,我们的模型可以估计实际执行时间,平均误差20%。这样的准确性足以让系统选择最有效的计划,即使执行时间差有限。如果将分析模型与我们的straggler处理策略结合在一起,则可以将错误减少到14%。
Keyword:
Spark
Spark SQL
cost model
query optimization
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
10.4
论文数:
6.8K
被引数:
3.2W
机构
引用论文
Electric field effects on the droplet structure in polymer dispersed cholesteric liquid crystals电场对聚合物分散胆甾相液晶中液滴结构的影响
Double-Pass Retina Point Imaging for the Evaluation of Optical Light Scatter, Retinal Image Quality, and Staging of Keratoconus双通视网膜点成像用于评估光学光散射,视网膜图像质量和圆锥角膜分期
Trajectory Prediction of Workers to Improve AGV and AMR Operation based on the Manufacturing Schedule基于制造进度的AGV和AMR作业工人轨迹预测
Capacity optimization of hybrid renewable energy system considering part-load ratio and resource endowment考虑部分负荷率和资源禀赋的混合可再生能源系统容量优化
Incidence of Dementia in Relation to Genetic Variants at PITX2, ZFHX3, and ApoE ε4 in Atrial Fibrillation Patients房颤患者中与PITX2,ZFHX3和apoeε4遗传变异相关的痴呆发生率
Aqueous-deficient dry eye disease: Preferred practice pattern guidelines on clinical approach, diagnosis, and management水缺乏性干眼病: 临床方法,诊断和管理的首选实践模式指南

