APP下载

基于PUSH机制的任务调度方法

2016-08-16张霄宏孙江峰赵文涛河南理工大学计算机科学与技术学院河南焦作454003中国科学院深圳先进技术研究院广东深圳518055河南省高等学校矿山信息化重点学科开放实验室河南焦作454003

中南大学学报(自然科学版) 2016年7期
关键词:机制作业方法

张霄宏,孙江峰,赵文涛(1.河南理工大学 计算机科学与技术学院,河南 焦作,454003;2.中国科学院 深圳先进技术研究院,广东 深圳,518055;3.河南省高等学校矿山信息化重点学科开放实验室,河南 焦作,454003)

基于PUSH机制的任务调度方法

张霄宏1,2,3,孙江峰1,3,赵文涛1,3
(1.河南理工大学 计算机科学与技术学院,河南 焦作,454003;
2.中国科学院 深圳先进技术研究院,广东 深圳,518055;
3.河南省高等学校矿山信息化重点学科开放实验室,河南 焦作,454003)

为降低Hadoop MapReduce环境中任务的数据访问延时进而提高系统性能,提出一种基于PUSH机制的任务调度方法。该方法根据输入数据分布,主动将任务推送到存储其输入数据的节点。当任务在这些节点执行时,可以直接从本地磁盘读取数据,从而避免远程数据访问延时。该方法已在hadoop-0.20.2中实现,并在真实集群中进行验证。研究结果表明:与原有调度方式相比,该方法可将作业执行时间平均降低8%,在最好情况下可降低14.3%。

数据局部性;性能优化;任务调度;MapReduce

为解决海量数据处理难题,Google公司率先提出了 MapReduce模型[1]。其开源实现 Hadoop MapReduce[2],已成为海量数据处理领域的主流模型之一,并获得了广泛应用[3-7]。然而,在Hadoop MapReduce环境中,当执行任务的节点与存储其输入数据的节点不是同一节点时,任务在执行过程中就不得不通过远程I/O操作来访问输入数据,从而引起不确定的远程数据访问延时,降低系统性能。且数据访问延时越大,系统性能越差。为减少数据访问延时,Hadoop缺省的调度方法总是把任务分配到离输入数据最近的节点执行。……

登录APP查看全文

猜你喜欢

机制作业方法
自制力是一种很好的筛选机制
作业
用对方法才能瘦
破除旧机制要分步推进
四大方法 教你不再“坐以待病”!
捕鱼
注重机制的相互配合
打基础 抓机制 显成效
我想要自由
三十六计第七计:无中生有