异构环境下MapRuduce任务调度算法优化
2015-04-21魏巍刘钊远
微型电脑应用 2015年6期
魏巍,刘钊远
异构环境下MapRuduce任务调度算法优化
魏巍,刘钊远
Hadoop作为世界领先的大数据平台,其性能更多地依赖于MapReduce任务调度机制。通过对MapReduce任务调度机制中推测算法的研究,提出一种高效、准确和基于优先级的改进Hadoop调度算法。通过测试发现,改进后的Hadoop调度算法在异构环境下能够对落后任务判定准确,更好地维持系统的负载平衡,减少系统对任务的响应时间,增加对高优先级任务的响应速度,提高MapReduce任务调度算法的性能。
异构环境;推测算法;负载均衡;优先级
0 引言
近些年来,在大数据背景下,ApacheHadoop已经逐渐成为研究的热点,业界对于开源Hadoop的应用也在不断的加深。Google、IBM、Microsoft、Amazon、Yahoo、Alibaba等IT互联网公司都推出了自己的云计算服务平台,并把云计算作为未来重要的战略目标[1-2]。大多数的开源云计算系统都是基于Hadoop应用平台,尤其在应用研究领域发展更为广泛。Hadoop应用框架最核心的设计是HDFS[3](分布式文件系统)和MapReduce,HDFS负责海量数据的存储,而MapReduce负责海量数据的计算。
MapReduce的优势之一在于容错机制对于用户透明化,并不需要用户去参与实现。当一个节点出现崩溃时,其上的任务被分配给其它的节点继续运行。类似情况,如果一个任务在一个节点上被执行的时间过长,则这个任务被称作掉队者任务或后备任务。把这个掉队者任务放在另外一个节点去执行,以便快速完成,这个过程称之为推测执行[4]。Hadoop现有的调度算法对于推测执行这一部分并不是很完善,主要体现在对后备任务的判定上。……
登录APP查看全文
