基于MapReduce模型的并行计算平台设计
2013-08-21邵伟
计算机光盘软件与应用 2013年9期
摘 要:现如今人们的生活已经进入了互联网时代,每天网络上都会形成海量的数据。对于互联网企业而言,需要对大量的数据进行系统分类,以便能够找寻对自身有价值的信息。MapReduce是一款能够用于大型计算机集群并发处理大量网络数据的模型,本文对该模型进行了系统的分析与研究,提出了一种更为通用且可扩展的平台。
关键词:并行计算;MapReduce模型;平台设计
中图分类号:TP338.6 文献标识码:A 文章编号:1007-9599 (2013) 09-0000-02
随着社会的不断发展与进步,互联网已经进入了web2.0时代,这就意味着更多的普通用户能够更为方便自由的使用互联网。对于互联网企业而言,web2.0在给企业带来海量数据的同时,也给企业数据收集带来了更多挑战。如何在大量的数据中收集对自身有价值的信息,成为企业发展的重中之重。并行计算思想的提出使得计算机计算速度以及处理能力有着显著的提高。也就是说,同一个数据的计算与处理可以在多个处理器中同时进行,把问题分解来提高处理速度。并行计算可以在一个包含多个处理器的超级计算机中进行,也可以在互联的多个计算机集群中进行。世界知名互联网企业Google公司每天均需要处理超过20PB的海量数据,这些大量数据的处理就是在该公司的高可扩展性分布式秉性基础框架上进行的。MapReduce是Google海量数据处理框架,在集群环境下,通过对数据的散布(map)和规约(reduce)来进行高并发计算。下面将分别介绍一下本文平台的关键设计策略。……
登录APP查看全文
