APP下载

基于聚类欠采样的集成分类算法

2021-12-09周传华朱俊杰徐文倩邓佳佳

计算机与现代化 2021年11期
关键词:分类

周传华,朱俊杰,徐文倩,邓佳佳

(1.安徽工业大学管理科学与工程学院,安徽 马鞍山 243000;2.中国科学技术大学计算机科学与技术学院,安徽 合肥 230000)

0 引 言

数据的不平衡现象一直存在并已引起了广泛关注[1]。例如软件缺陷预测[2]、入侵检测[3-4]、信用卡欺诈[5]等应用领域中的数据倾斜。研究表明,当某个类别的数量远大于其他类别的数量时,传统的分类算法更加关注多数类样本。如何提高模型对少数类样本的分类性能,是目前亟待解决的重要问题。

不平衡数据不同于噪声和离群值,它不是由数据生成过程中的错误引起的问题,而是由于大多数应用领域的本身性质而导致的,因此无法避免。目前对不平衡数据的处理方法主要分为2类[6]。第1类是数据层面,首先进行数据预处理,使用重采样方法平衡具有倾斜度的类分布,这类方法主要包括对少数类的过采样,以及对多数类的欠采样;第2类是算法层面,通过修改算法对数据集的偏差,主要有代价敏感学习[7-8]和集成学习[9-10]。代价敏感学习是通过为少数类样本分配更高的成本值并优化其成本错误目标函数。集成学习是通过前面的分类器增加错误分类的样本权重来解决不平衡问题。本文将数据层面的欠采样方法与算法层面的集成学习相结合,并将其应用于不平衡分类问题中。

欠采样是通过删除大多数样本来保持数据平衡[11]。Kubat等[12]提出,欠采样算法的效果优于过采样。文献[13]提出了随机欠采样(RUS)能够快速从多数样本中随机选取并删除一些样本达到样本分布平衡。……

登录APP查看全文

猜你喜欢

分类
分类算一算
垃圾分类的困惑你有吗
星星的分类
我给资源分分类
垃圾分类,你准备好了吗
按需分类
教你一招:数的分类
说说分类那些事
给塑料分分类吧