面向不平衡数据的三支决策混合采样算法研究
2021-01-08陈丽芳代琪刘洋刘保相
山西大学学报(自然科学版) 2020年4期
陈丽芳,代琪,刘洋,刘保相
(1.华北理工大学 理学院,河北 唐山 063210;2.中国石油大学(北京) 自动化系,北京 102249)
0 引言
不平衡数据普遍存在于生活的各个领域。由于不平衡数据集中类间数量不均衡,从这些数据中进行分类学习需要新的算法及工具,以便从原始数据中有效获取有价值信息[1-2]。因此,针对不平衡数据的分类问题,常见的处理方法分为两类:一类是从数据层面出发,对训练集进行重采样;另一类则是在不改变数据集分布的前提下,对分类算法进行改进,增强算法对不平衡数据结构的适应能力,提升算法的分类精度。在实际应用中,数据采样技术因其计算量小,提升效果明显而备受关注,主要分为欠采样、过采样和混合采样。
欠采样的基本思想是通过删除一部分多数类样本,使数据集实现再平衡。其中,随机欠采样[3]是欠采样技术中简单易行的方法,虽然该方法具有操作简单、易实现等优点,但删除过程中容易删除多数类有价值样本,造成信息丢失,算法分类精度提升不明显。Sun等[4]将Bagging算法引入欠采样EUS方法中,提出新的欠采样算法EUS-Bag。Kang[5]等指出少数类样本中可能存在噪声,降低分类器分类性能,从而提出一种结合噪声滤波器的欠采样算法。魏力[6]等结合NearMiss算法和K-means聚类算法的优点,通过计算聚类簇中心点之间的NearMiss距离,对聚类中心赋予不同的选择权重,提出一种新的欠采样算法。
过采样主要是在多数类与少数类之间生成一部分少数类样本的人造数据,实现数据的再平衡。……
登录APP查看全文