神威太湖之光可靠性及可用性设计与分析
2021-12-14高剑刚龚道永方燕飞何王全金利峰李宏亮
计算机研究与发展 2021年12期
高剑刚 胡 晋 龚道永 方燕飞 刘 骁 何王全 金利峰 郑 方 李宏亮
(国家并行计算机工程技术研究中心 北京 100190)
过去数十年,随着半导体集成电路工艺与系统规模的不断提升,高性能计算机计算性能得到了快速的发展.当前,为了满足气象、生命科学、高能核物理等大规模科学应用对计算能力的超高需求,E级计算(1000PFLOPS)已成为高性能计算领域的下一个研制目标.然而,由于系统规模与复杂度的不断增加,故障失效成为超级计算机系统运行过程中的普遍事件,当系统性能由P级(PFLOPS)向E级扩展时,系统保存全局检查点的时间可能达到甚至超过系统的平均无故障时间(mean time between failures, MTBF)[1],可靠性墙[2]正成为构建E级计算机系统所面临的一项巨大挑战.
可靠性是指系统在规定的条件和规定的时间内,完成系统功能的能力,而可用性是指系统在规定的条件和时间区间内处于可执行规定功能状态的能力,是可靠性和维修性的综合体现.超级计算机系统结构复杂、规模庞大,可靠性与可用性问题日益严峻,必须研究采用可靠性增强技术,提高系统基础可靠性,同时必须有效采用故障容错技术,提高系统在频繁故障环境下的运行效率,破解高性能计算机系统高可用难题.
神威太湖之光是世界首台性能超过10亿亿次并行规模超千万核的超级计算机.本文对神威太湖之光超级计算机系统可靠性与可用性进行全面的研究,分析高性能计算机失效特性与故障容错技……
登录APP查看全文
