APP下载

Java流机制在Hadoop分布式文件系统中的应用

2018-04-09庞双玉

电子技术与软件工程 2018年5期

庞双玉

摘 要 本文讨论JAVA语言中的流机制在HDFS分布式文件系统读写操作中的应用,通过对比JAVA中的输入和输出流机制和HDFS的读写操作,阐述java流思想的本质,以及Java在分布式系统开发中的优越性。

【关键词】Java 分布式系统 数据

1 引言

Apache Hadoop是一个分布式开源的软件系统框架。它被用于分布文式文件系统和用MAP/REUDUCE机制处理的大数据处理模型中。它包含多个由通用商业硬件组成的计算机集群。Hadoop中所有的模块设计都基于一个基本的假设即硬件错误是普遍发生并且可以自动被处理的。

Hadoop的核心包括分布式的文件系统存储即HDFS。Hadoop是用Java语言开发的,本文讨论Java语言中的流机制在HDFS文件系统设计中的应用。

2 Java语言中的流机制

流是java语言所特有的机制,把数据的存取想象成从一个源源不断的数据流中读取,在Java中,创建输入和输出流对象时,以要操作的文件对象或者数据源头作为构造方法参数,将输入和输出流与操作对象关联。

流的一端可以是数据、设备、网络、内存,根据数据的流向,数据从网络,设备,内存等到创建好的流,称为输入流,数据从创建好的流到网络,设备,内存等,称为输出流。如图1、图2所示。

3 Hadoop和HDFS文件系统

Hadoop是Apach公司实现的一个框架,用Java语言开发,从本质上说,hadoop实现了一个分布式集群,这个集群中有一个master节点和多个slave节点,核心机制是Map/Reduce数据处理机制和HDFS文件系统,HDFS是分布式文件系统,它采用数据块和多节点备份机制,保证了高可靠性和容错性。

4 对HDFS文件系统的访问

对HDFS文件系统的访问,有两种方式,一种通过java.net.URL访问,一种是通过FileSystem来访问。……

登录APP查看全文