基于词项和语义融合的地铁信号设备故障文本预处理
2021-03-12胡小溪
铁道学报 2021年2期
胡小溪,牛 儒,唐 涛
(北京交通大学 轨道交通控制与安全国家重点实验室, 北京 100044)
在大数据和人工智能的推动下,基于数据驱动的故障诊断[1-2]得到了较快发展,文本数据驱动是其重要分支之一。文本故障数据大量存在于工业界中,是一种以自然语言描述方式存在的非结构化数据,蕴含大量的故障信息,基于文本数据驱动的故障诊断在近年逐渐发展起来[3-4]。但工业界的故障文本记录仍采取人工记录方式,大量故障记录存在模糊性和不规范性,使故障诊断网络的节点数目造成不必要的增多,网络复杂性增大,直接进行故障诊断可能丢失重要信息,造成正确率下降。因此实现故障的文本预处理具有重要意义。
故障文本预处理包括分词与特征提取[5]。在分词方面,文献[6-7]采用基于词库匹配的分词方法实现了对故障记录的识别,该方法实现相对简单、效率较高,但文本识别过程受词库约束较大,需要耗费大量人力维护词库,且无法彻底解决多词同义现象。在特征提取方面,常见的方法包括词频-逆文档频率[8](Term Frequency-Inverse Document Frequency, TF-IDF)、Chi-square分布检验[9]、信息增益、互信息等,其中TF-IDF和Chi-square分布检验简单有效,应用较为广泛。
针对某线路信号设备故障记录的特点,本文提出了一种基于词项和语义融合的轨道交通信号故障文本自动预处理方法。针对各轨道交通线路设备故障记录的独特性、既有的轨道交通词库的不全面性,采用统计学习方法Viterbi-HMM模型[10-11]学习词语的切分规律,用字与字间的共现概率识别新词,形成线路专用信号故障词库,以简化线路专用词库的人工维护量。……
登录APP查看全文
