面向搜索引擎的分布式文件系统性能分析*
2011-01-24董守斌赵铁柱
华南理工大学学报(自然科学版) 2011年4期
董守斌 赵铁柱
(华南理工大学广东省计算机网络重点实验室,广东广州510640)
随着互联网技术的发展,计算、传输和存储三大IT基础技术都得到了飞速的发展.但相对于计算(数据处理)和传输而言,存储技术发展缓慢.海量数据的存储和检索已成为制约互联网发展和分布式应用的关键问题.搜索引擎是数据密集型的应用,其系统性能极大地依赖于底层的文件系统.如果单纯依赖操作系统提供的文件系统基本功能,搜索引擎系统将无法获得理想的性能.因此,搜索引擎均采用分布式文件系统来解决这个问题.分布式文件系统具有高吞吐量、高I/O带宽和可扩展等特点,它可以将多个节点上的硬盘组织成为全局的存储系统,提供聚合的存储容量和I/O带宽,并易于随系统规模扩大而扩展.
20世纪80年代网络文件系统NFS(Network File System)的出现使得分布式文件系统逐渐发展并应用到各个领域.目前分布式文件系统在体系结构、系统规模、性能、可扩展性、可用性等方面均经历了较大的变化.主流的分布式文件系统如Lustre等已应用在高性能计算和云计算等相关领域.但由于搜索引擎对数据存取有特殊的需求,搜索引擎专用的分布式文件系统应需而生.GFS(Google File System)[1-2]和 HDFS(Hadoop Distributed File System)[3]等均是专用于满足搜索引擎应用需求的分布式文件系统.但这些专用的搜索引擎分布式文件系统是否在支持搜索引擎以及类似应用时比通用型的分布式文件系统具有更好的性能,目前尚无定论.文……
登录APP查看全文