浅析基于HDFS的分布式Namenode模型
2016-06-06司雅楠阮宁
司雅楠++阮宁



摘要:大量的信息以数据的形式进行存储和处理,如果能够以最佳的方式存储、访问和分析所有产生的数据,就可以创造出价值。面对如此海量的数据,Hadoop文件系统(HDFS,Hadoop Distributed File System)展现出了它的优越性。但是基于单一NameNode节点的HDFS文件系统表现出了单点失效、单点瓶颈和扩展性差几个问题。为了解决单一NameNode成为整个集群性能瓶颈的问题,本文提出一种基于HDFS的分布式NameNode模型,并对分布式NameNode结构的总体设计进行介绍。
关键词:HDFS;单一NameNode;分布式NameNode
中图分类号:TP311 文献标识码:A 文章编号:1009-3044(2016)06-0239-03
信息的数据化使得每天都有大量的数据产生,据统计现在人们创造与复制的数据量每两年就会增加一倍。这种增长趋势仍在加速,接下来几年中,数据始终保持每年50%的增长速度。这些数据的数量之大种类之多,已经无法用传统的数据处理工具加以分析,这也促进了新的数据处理技术应运而生。以云计算[1]为基础的信息数据挖掘技术,可低成本、高效率地将这些数量巨大、结构多样的终端数据存储下来,实时地进行分析和计算。
大数据[2]和云计算两个概念相辅相成,大数据中蕴含了丰富的信息和潜在价值,而云计算的出现,帮助我们更好的对大数据中的价值进行分析,获得新的认知、创造新的价值。Hadoop作为基础云计算平台已经得到了广泛的应用。Hadoop[3]的两大核心模块是HDFS[4]和MapReduce[5],其中HDFS是Hadoop体系结构中的底层支持。
1 HDFS的基础构架[6]
Hadoop的分布式文件系统(HDFS,Hadoop Distributed File System)作为Hadoop云平台的核心组件,其主要负责海量数据的存储工作。……
