基于HDFS的大数据文件传输实验设计
2020-01-13刘文杰
实验室研究与探索 2019年12期
关键词:系统
刘 文 杰
(大连理工大学 软件学院,辽宁 大连 116621)
0 引 言
云计算已经成为互联网服务的重要支撑。通过对软件即服务(Software as a Service,SaaS)概念的扩展和延伸,使云计算能够提供移动化的超级计算服务,以及大型数据中心的数据处理服务[1]。云计算的应用已经成为计算机技术发展的重要方向。
Hadoop是Apache开源组织的分布式开源云计算编程平台,已经成为主流网络应用的重要组成部分,其扩展功能也在不断增强[2]。该平台依靠其在扩展性、经济性、可靠性、高效性等方面的绝对优势,成为海量数据中心、搜索引擎、分布式集群计算等重要应用领域的核心处理平台[3]。由于其开放式框架的特点,Hadoop平台能够在集群平台上处理大型数据库应用,通过HDFS和MapReduce实现备份恢复机制和人物监控,这一理念已经在很多大型网站上得到了应用,可以说是目前最为广泛应用的开源云计算软件平台[4]。Hadoop平台为项目开发过程带来了新的理念,通过并行计算方式发实现分布式计算框架中海量数据的分割,程序设计人员可以在不改变开发方式的情况下,实现云计算应用系统的并行化[5]。Hadoop平台的开放性和可延续性,其优缺点需要在长期的使用过程中加以验证和修正。
1 HDFS体系结构
Hadoop分布式文件系统(Hadoop Distgributed File System,HDFS)主要运行在通用硬件(commodity hardware)上,为分布式计算存储提供底层应用支持[6]。该系统具有高容错性、高吞吐量等特点,使其在较低的硬件资源平台中提供大规模数据及应用,并通过降低POSIX约束,实现流失读取文件系统数据功能。……
登录APP查看全文
