不平衡数据中基于异类k距离的边界混合采样
2021-02-25于艳丽江开忠盛静文
计算机应用与软件 2021年2期
于艳丽 江开忠 盛静文
(上海工程技术大学数理与统计学院 上海 201620)
0 引 言
不平衡数据指的是数据集中存在不同类别样本的数目相差很大。以二分类数据为例,征信领域中诚信与违约、医疗领域中健康与绝症、邮箱里正常邮件与垃圾邮件,这些二分类数据中某一类数据数量远多于另一类,这样的数据就称为不平衡数据[1-4]。将数量较少的类别称为少数类,将数量较多的称为多数类。现实世界中,随处都有不平衡数据,且错分两类数据的代价是不同的,通常对少数类的正确判断更有意义[5]。传统的分类方法对于平衡的样本数据已经表现出很好的性能,但是对于不平衡数据,分类器的性能在下降。如何提升传统分类方法对少数类的识别准确率成为机器学习中一个急需解决的问题[1,6]。目前,解决不平衡数据问题的方法可以分为如下两类:
1) 改进分类算法以提高对少数类样本的识别,如:代价敏感学习[7]、集成学习[8]和单类学习等。AdaBoost算法[9]就是其中比较经典的处理不平衡数据的集成算法,本身就具有代价敏感的特性,能够给予误判样本更高的权重。一些算法通过更改AdaBoost算法中样本更新权重来增加正确率,如AdaCost算法[10]和RareBoost算法[11]。还有些算法将采样算法与集成算法相结合,例如NIBoost[12]、RSBoost[13]和PCBoost[14]。另外还有其他分类算法,如:SVM[2]、决策树、神经网络等,它们也经常被用来处理不平衡数据。
2) 通过处理原始数据来提高对少数类样本的识别,即对数据进行欠采样或者过采样来达到数据平衡的目的。……
登录APP查看全文
