基于机器学习的大规模并行计算机系统硬件故障检测方法
2022-06-21刘伟峰
技术与市场 2022年6期
刘伟峰
(陕西工商职业学院,陕西 西安 710119 )
0 引言
大规模并行计算机系统简称MPP系统,属于巨型计算机系统,主要由大量处理器构成,通过采用大量的处理器与服务器来提高计算机系统运行速度和质量,该系统最早是在20世纪60年代研发的,最初大规模并行计算机系统主要应用在气象领域、人类学领域、医学领域以及军事领域。大规模并行计算机系统主要利用有效的并行算法实现对计算机数据的运算,其具有规模大、运行速度快、传输速度快以及响应时间短等特点,目前已经被广泛应用到多个领域。
虽然大规模并行计算机系统的应用为计算机用户带来了更多的便利,并且也取得了良好的应用效果,但是由于大规模并行计算机系统硬件结构比较复杂,所涉及的硬件数量比较多,长时间处于高速运转状态下,大规模并行计算机系统硬件设备非常容易出现故障,当其中任意一个硬件设备出现故障,就会影响到大规模并行计算机系统的操作和使用,甚至出现系统瘫痪。
为了解决该问题,相关研究人员提出了大规模并行计算机系统硬件故障检测方法,现有的检测方法主要为基于人工智能的系统硬件故障检测方法,该方法在实际应用中运算量比较大,并且所使用的故障检测算法不够合理,对不同类型的系统硬件故障检测准确率较低,已经无法满足大规模并行计算机系统硬件故障检测需求,为此本文提出基于机器学习的大规模并行计算机系统硬件故障检测方法。……
登录APP查看全文
