一种基于条带的一致性散列数据放置算法
2021-04-07高艳珍孙凝晖
魏 征 窦 禹 高艳珍 马 捷 孙凝晖 邢 晶
1(计算机体系结构国家重点实验室(中国科学院计算技术研究所) 北京 100190)2(中国科学院大学 北京 100190)
在大数据时代,数据因为其体现的价值而越来越多地受到重视.数据规模正呈爆发式地增长,根据互联网数据中心(International Data Corporation, IDC)的统计预测,预计到2022年市场规模将达1 891亿美元[1],到2025年全球数据总量将达175 ZB[2].面对持续增长的海量数据,分布式存储系统成为存储研究方向的热点之一.
分布式文件系统通常在数据中心中以存储集群的方式来实现[3].在数据中心中包含了计算存储、网络、电力等众多设备,各类设备故障都威胁着存储数据的可靠性.各类出错因素的积累,使得存储服务器的失效成为常态[4].分布式存储系统通过副本和纠删码机制提供数据可靠性存储技术,保证当某个节点失效时不会对存储的数据产生影响.其中纠删码能够达到甚至超过3副本的可靠性[5-6].纠删码在Google的GFS[7]、Microsoft的Azure[8]以及Facebook的存储系统[9]等商业系统中都有应用.纠删码与RAID类似,将数据分组组成条带(stripe).每个条带中有N块数据,数据经过编码矩阵编码产生N个数据块和M个校验块.N个数据块和M个校验块构成一个纠删码条带.纠删码条带中的数据块用于数据读取.纠删码编码产生的纠删码条带具备最大距离可分码(maximum distance separable, MDS)性质[10],即任意不多于M块数据丢失,都能恢复原始数据.
分布式文件系统从系统结构上可以分为有中心和无中心2种.有中心的分布式文件系统是在集群……
