基于改进的BSMOTE和时序特征的风机故障采样算法
2021-07-02赵计生强保华米路中唐成华李宝莲
杨 鲜,赵计生,强保华*,米路中,彭 博,唐成华,李宝莲
(1.广西图像图形与智能处理重点实验室(桂林电子科技大学),广西桂林 541004;2.北京华电天仁电力控制技术有限公司,北京 100039;3.中国电子科技集团公司第54研究所,石家庄 050081)
(∗通信作者电子邮箱qiangbh@guet.edu.cn)
0 引言
随着风机设备可靠性的不断提高,设备出现故障的概率逐渐变小,导致了风机运行数据集中很大比例都是正常运行的样本数据,而出现故障的样本数据比例非常小,从而使数据集不均衡。不均衡的数据集会对风机部件故障检测[1]的效果产生负面的影响,分类结果往往都会偏向于大类样本。因此在建立分类模型之前,如何对风机数据集进行处理[2-3],消除由不平衡性带来的负面影响尤为重要。
针对不平衡数据集通常使用抽样方法对其进行改善,常见的解决方法主要有欠采样和过采样两种方式,其核心分别是通过合理地减少大类样本数量和增加小类样本数量,以期获得一个较为平衡的数据集。目前国内外学者对抽样方法的研究主要有:Chawla 等[4]提出在少数类样本之间进行插值产生额外样本的SMOTE(Synthetic Minority Oversampling Technique)算法,该算法可能导致样本之间的重叠,生成一些没有提供有效信息的样本,降低分类性能;Han 等[5]在SMOTE算法基础上进行改进提出BSMOTE(Borderline Synthetic Minority Oversampling Technique),该算法仅对边界上的少数类样本合成新样本,减少了未提供有效信息的样本被合成的可能性,但选择样本时未考虑数据集的时序规律,且未对噪声类样本进行过滤;Bunkhumpornpat 等[6]提出一种根据每个少数类样本安全等级来决定是否过采样的Safe-level SMOTE 算法;……
