大数据Hadoop框架核心技术对比与实现
2021-03-23张国华王自然周婷婷
实验室研究与探索 2021年2期
张国华,叶 苗,王自然,周婷婷
(南京师范大学泰州学院信息工程学院,江苏泰州 225300)
0 引言
Hadoop[1]是一个软件框架模型,主要用于以高效和可扩展的方式对大数据进行分布式信息处理,具有可靠性高、容错能力强、搭建成本低、跨平台等特点。它在处理半结构化,非结构化的数据方面优势明显,目前得到了广泛应用,社会对于这方面的技术人才需求量巨大,因其概念繁多,原理复杂,掌握其核心技术的人才较少。为将Hadoop生态系统理顺,本文从整体框架(见图1)分析,在整个生态系统中最为核心的两个技术,一个是HDFS[2]实现的基础数据的分布式存储,它利用集群存储数据的能力,扩展了计算机的存储能力。这个技术对比单机版的文件系统,例如Windows的文件系统FAT32,NTFS等就能区分其区别。其次是实现分布式并行编程模型MapReduce[3],它是利用廉价的计算机集群的综合处理能力来处理HDFS上的数据,相对于传统并行计算框架,无须昂贵的服务器就可批处理非实时的海量数据。

图1 Hadoop生态系统
仔细分析图1 及查阅相关文献,不难发现涉及对底层HDFS 数据处理的技术主要有MapReduce、Spark[4]、Hive、Pig等。为研究上述数据处理技术的区别及优势。本文以最为经典的分布式程序WordCount为例,设计了不同技术方法下的实验,对比其适用场景及优势,帮助学生迅速理解并掌握相关技术原理及方法。
1 技术原理与对比
1.1 MapReduce
MapReduce 是一种分布式并行编程模型,是Hadoop 生态系统中的最为核心和最早出现的计算模型,MapReduce借助集群的力量解决大型数……
登录APP查看全文
