APP下载

HDFS 存储和优化技术研究综述*

2020-03-31金国栋卞昊穹陈跃国杜小勇

软件学报 2020年1期

金国栋 , 卞昊穹 , 陈跃国 , 杜小勇

1(数据工程与知识工程教育部重点实验室(中国人民大学),北京 100872)

2(中国人民大学 信息学院,北京 100872)

3(大数据系统软件国家工程实验室(北京理工大学),北京 100081)

近年来,随着大数据技术在各行各业中的应用和发展,大量的实际应用中数据量都超出了常规单机的存储和计算能力.分布式水平扩展成为了大数据系统的必由之路.在面向分析的大数据系统中,由于需要分析和处理大批量的历史和新生数据,大规模的水平扩展更成为了最为迫切的需求.HDFS(Hadoop distributed file system)旨在解决大数据的分布式存储问题,它随着Hadoop 生态圈一起出现并发展成熟,具有开源、可移植、高可用、高容错、可大规模水平扩展等特性.随着Hadoop 生态圈的繁荣发展,HDFS 也在各行各业的大数据系统中得到了广泛的应用.

HDFS 作为底层的文件存储系统,其上支撑着非常丰富的应用场景,如复杂查询分析、交互式分析、详单查询、Key-Value 存储和查询、迭代计算等.上层的系统和应用从HDFS 读取数据并向HDFS 写入数据或者中间结果.HDFS 的性能问题将影响到其上所有大数据系统和应用,因此,HDFS 性能的优化变得至关重要.但HDFS的性能优化非常具有挑战性.作为一个通用的分布式文件系统,在优化HDFS 时,要保证其稳定和通用的访问接口以及高可用性和高可扩展等其他特性,其性能优化存在很多限制.并且,由于硬件设备的发展和Hadoop 上应用的丰富性,性能优化往往需要针对特定的硬件和应用.因此,在保证……

登录APP查看全文