大规模分布并行计算系统容错与恢复技术
2014-03-31张新洲周敏奇
华东师范大学学报(自然科学版) 2014年5期
张新洲, 周敏奇
(华东师范大学 软件学院,上海 20062)
0 引 言
随着大数据时代的到来,系统所需要承受的计算任务变得越来越复杂,因此系统在硬件技术以及软件优化方案上都有进一步的改善和提高.对于高性能计算机系统来说,为了应对日益增长的数据量规模、逐渐增强的计算复杂度,需要添加越来越多的高性能组件.随之带来的结果是,长时间的运行分布式程序,由硬件失效造成的系统终端失效概率变大,此外,当一个系统应用程序失败时,会消耗更多的恢复成本,因为集群系统中会更多的计算结果都会随之丢失.因此,分布式系统和并行系统双方对于容错机制的支持至关重要,以此来确保大规模计算环境的可用性.
本文专注于集群系统,以及在集群环境下运行的分布式应用程序.集群系统是由大量相同的、集中管理的计算节点通过以太网或者万兆网连接在一起的分布式系统.节点间采用如MPI等软件协助各个节点融入成为一个更大的、统一的集群系统;通常一些节点作为主节点用于管理和用户交互.
在集群环境中,各个节点出现故障的概率较高.任何组件的任何计算节点都有可能出现失效,包括处理器,硬盘,存储器网络接口等硬件.一个节点上的硬件或者软件故障都有可能会影响到整个系统的调度以及造成数据的丢失.第1节将概述这些故障的理论模型.
通常来说可能发生在集群系统中的故障主要有两……
登录APP查看全文