APP下载

决策树模型预测Spark SQL作业执行时间的方法

2021-04-15吴恩慈

计算机应用与软件 2021年4期
关键词:作业模型

吴 恩 慈

(上海淇毓信息科技有限公司 上海 200120)

0 引 言

Spark SQL借助核心引擎将集群规模扩展到数千个节点,Catalyst提供了基于规则和代价的优化器,把数据仓库的计算能力推向新的高度。但在超大规模数据集上存在易用性和可扩展性的问题,SQL或Dataset程序在执行之前被解析成逻辑计划,然后生成可执行的物理计划,不同的执行计划对性能有很大的影响。若能够准确预测作业的执行时间,可以更加充分地运用作业运行时获取的数据,动态地选择一个最佳的物理执行计划。例如基于作业运行时Shuffle信息,根据机器学习模型预测结果自动为每个作业设置合适的Shuffle Partition值,调整可能发生数据倾斜的任务并行度,动态地调整执行计划,能够有效提升集群性能。

1 相关工作

文献[1]研究了预测Hadoop分布式存储系统中查询执行时间的方法,采用KCCA统计模型关联查询输出大小与执行时间,通过最近的类似查询的性能预测作业执行时间。文献[2]提出了一种混合模型估计不同类型算子的性能,在关系型数据库中有良好的表现。文献[3]使用样本数据模拟集群中不同节点的执行性能,存在Shuffle开销的IO密集型作业的预测精度较低。文献[4]提出了一种多元线性回归方法,根据Spark性能指标预测集群性能,模型指标R2小于平均值。文献[5]研究了更改Spark集群配置参数对性能的影响,在模型训练阶段捕获关键性能指标,允许用户询问配置参数对性能的影响。文献[6]通过分析MapReduce任务执行过程中收集的数据,提出两阶段回归方法预测任务的完成时间。……

登录APP查看全文

猜你喜欢

作业模型
一半模型
让人羡慕嫉妒恨的“作业人”
作业联盟
重尾非线性自回归模型自加权M-估计的渐近分布
3D打印中的模型分割与打包
作业
FLUKA几何模型到CAD几何模型转换方法初步研究
我想要自由
三十六计第七计:无中生有
一个相似模型的应用