不平衡数据加权边界点集成欠采样方法
2021-09-02何云斌
西安电子科技大学学报 2021年4期
关键词:分类
何云斌,冷 欣,万 静
(哈尔滨理工大学 计算机科学与技术学院,黑龙江 哈尔滨 150000)
近年来,随着人工智能和大数据的发展,不平衡数据已经广泛出现在人们的现实生活中,如医学领域[1]、信用卡欺诈检测[2]、文本分类[3-4]、垃圾邮件的检测[5]以及故障检测[6]等领域。在以上领域少数类数据集往往发挥更重要的作用。但是人们一直忽略少数类信息所特有的价值,过多地关注多数类信息,而且被错分的样本往往是少数类数据,因此提高少数类的识别率是非常有必要的。
文献[7]提出基于聚类的欠采样方法,将多数类中的簇数设置为等于少数类中的数据点个数,提出两种策略进行聚类:第1种是使用聚类中心来表示多数类,第2种是使用每个聚类中心的最近邻来表示多数类。研究了5到10个聚类中心的添加或删除对多数类数据性能的影响。文献[8]提出一种基于样本权重的不平衡数据欠抽样方法(KAcBag),通过bagging成员分类器得到若干决策树子分类器,最后进行加权投票生成预测模型。该算法所选数据具有较强的代表性,可以有效提高少数类的分类性能,但是在聚类时需要通过实验来获得聚类次数、类簇的个数以及簇减少的步长等参数,耗费时间较多。文献[9]提出一种基于距离的支持向量机加权欠采样方法,是一种改进的WU-支持向量机算法,将大多数样本划分为一些子区域(SRS),并根据它们到超平面的欧几里得距离分配不同的权重。文献[10]通过改进惩罚函数,有效处理含有噪声点的非平衡数据集,并采用网格搜索算法来确定各个支持向量机模型中参数的优化取值。……
登录APP查看全文
