APP下载

大数据Hadoop框架核心技术对比与实现

2021-03-23张国华王自然周婷婷

实验室研究与探索 2021年2期
关键词:数据处理实验

张国华,叶 苗,王自然,周婷婷

(南京师范大学泰州学院信息工程学院,江苏泰州 225300)

0 引言

Hadoop[1]是一个软件框架模型,主要用于以高效和可扩展的方式对大数据进行分布式信息处理,具有可靠性高、容错能力强、搭建成本低、跨平台等特点。它在处理半结构化,非结构化的数据方面优势明显,目前得到了广泛应用,社会对于这方面的技术人才需求量巨大,因其概念繁多,原理复杂,掌握其核心技术的人才较少。为将Hadoop生态系统理顺,本文从整体框架(见图1)分析,在整个生态系统中最为核心的两个技术,一个是HDFS[2]实现的基础数据的分布式存储,它利用集群存储数据的能力,扩展了计算机的存储能力。这个技术对比单机版的文件系统,例如Windows的文件系统FAT32,NTFS等就能区分其区别。其次是实现分布式并行编程模型MapReduce[3],它是利用廉价的计算机集群的综合处理能力来处理HDFS上的数据,相对于传统并行计算框架,无须昂贵的服务器就可批处理非实时的海量数据。

图1 Hadoop生态系统

仔细分析图1 及查阅相关文献,不难发现涉及对底层HDFS 数据处理的技术主要有MapReduce、Spark[4]、Hive、Pig等。为研究上述数据处理技术的区别及优势。本文以最为经典的分布式程序WordCount为例,设计了不同技术方法下的实验,对比其适用场景及优势,帮助学生迅速理解并掌握相关技术原理及方法。

1 技术原理与对比

1.1 MapReduce

MapReduce 是一种分布式并行编程模型,是Hadoop 生态系统中的最为核心和最早出现的计算模型,MapReduce借助集群的力量解决大型数……

登录APP查看全文

猜你喜欢

数据处理实验
记一次有趣的实验
认知诊断缺失数据处理方法的比较:零替换、多重插补与极大似然估计法*
ILWT-EEMD数据处理的ELM滚动轴承故障诊断
做个怪怪长实验
NO与NO2相互转化实验的改进
实践十号上的19项实验
MATLAB在化学工程与工艺实验数据处理中的应用
基于POS AV610与PPP的车辆导航数据处理
依托陆态网的GNSS远程数据处理软件开发
《实验流体力学》征稿简则