基于Spark流处理的轴承剩余使用寿命预测*
2021-11-29马荣杰吴文江
马荣杰,吴文江,胡 毅
(1.中国科学院大学,北京 100049;2.中国科学院沈阳计算技术研究所,沈阳 110168)
0 引言
数控机床是高端制造业的一个基本资源,减少故障时间,增加机床的使用效率,为企业创造了更多的经济效益[1],是一个紧迫的问题[2]。滚动轴承由滚动体、保持架、轴承内圈和轴承外圈组成[3]。数控机床系统产生的运行数据正逐渐出现高容量、高速度、多样性和低值的“4V”大数据特性[4]。故障具有隐蔽性及复杂性的特点[5],如何从大量历史数据中提取关键信息并预测设备的运行状况,对于设备的预先维修和正常运行至关重要[6]。文献[7]利用基于广泛数据的存储和管理技术、数据检索和分析技术,收集机床运行期间产生的大量数据,并对历史数据进行在线存储和分析。文献[8]对工业能耗大数据分析平台进行研究,对能耗数据进行离线分析,实现了能耗与设备综合信息的聚类与影响分析。当前,工业大数据处理技术的应用主要集中在以Hadoop为核心的离线处理框架上。然而,对数控机床海量运行数据的实时监测要求处理系统更加高效[9]。基于机床运行数据的特殊性,传统的离线数据处理框架难以满足实时流处理和动态弹性计算等需求。
目前主流的大数据流处理框架有Storm、Spark Streaming和Flink[10]。Spark Streaming在实时性方面不如Strom。然而Spark Streaming的集成性更好,通过RDD不仅可以和Spark进行衔接,也可以很容易的与Kafka结合。同时Spark Streaming的吞吐量也远远高于Strom。Spark Streaming可以支持秒级计算,它属于微小批次处理框架,Flink属于准实时处理框架,它支持毫秒级计算,然而本文对轴承剩余寿命的预测精度为分钟量级,所以都可以满足条件,同时Spark对SQL的支持比Flink要多一些,而且支持对SQL的优化。……
