APP下载

高性能集群系统运维浅析

2018-08-18赵亮

数字技术与应用 2018年4期

赵亮

摘要:网络的飞速发展,气象数值预报高分辨率循环同化系统对服务器提出了更高的要求,使用Linux操作系统构建高性能集群系统,用较低的价格实现高伸缩、高可用的计算服务,以弥补单台服务器无法达到的性能。本文以实际生产运行中的一则故障为例,剖析了系统运维中的一些方法。

关键词:数值预报;集群;运维

中图分类号:TP38 文献标识码:A 文章编号:1007-9416(2018)04-0190-01

1 集群的概念

集群是指一组协同工作的服务集合,可以提供比单台服务更稳定、高效、具有扩展性的服务平台。整体来看,集群是一个独立的服务实体,而实际上,在集群内部,有多个服务实体在协同完成一系列复杂工作。集群一般由两个或两个以上的服务器搭建而成,每台服务器称为一个集群节点。当一个节点出现故障时,集群的另一节点可以自动接管故障节点的资源,从而保证服务持续、不间断运行[1]。

综上,搭建一套集群系统需要N(N>=2)台服务器,同时还需要IB线缆、集群软件、共享存储设备(磁盘阵列)等,如下图1所示。

2 故障实例

某日,GRIDVIEW集群综合管理系统显示Node52节点异常,按照处理流程,使用Blade Full View Management System对告警节点进行“硬重启”操作。在等待数分钟后,节点依然显示告警,重复上述操作故障依旧。我们使用SKMV OVER IP系统登录告警节点查看,发现该节点无法进入Linux系统,服务器硬盘有报错,使用fsck命令校正文件系统依然无效,因此决定更换Node52服务器硬盘。但更换新硬盘后需要重新安装该节点的Linux操作系统以及各种集群服务,操作较为繁琐且冗余,我们可以使用拷贝安装的方式来进行修复工作。……

登录APP查看全文