面向不均衡数据集的过抽样算法
2020-06-21崔鑫,徐华,宿晨
计算机应用 2020年6期
关键词:分类
崔 鑫,徐 华,宿 晨
(江南大学物联网工程学院,江苏无锡 214122)
(∗通信作者电子邮箱1525754926@qq.com)
0 引言
不均衡数据,即各类别样本数量分布严重不平衡的数据。对于均衡数据,传统分类算法可以取得良好的分类效果,但在实际问题中,如人脸年龄估计、异常检测、软件缺陷预测、图像标注等,需要分类的数据通常是不均衡的。而传统分类方法用以解决不均衡数据分类问题,往往在少数类上的分类效果并不能让人满意。这是由于不均衡数据中少数类数量过少,导致数据集并没有包含足够的分类信息。此外传统分类方法追求整体的正确率最大化导致分类结果更倾向于多数类,而可能误分类人们更关注的少数类。所以针对不均衡分类问题,学术界有必要去寻找一种行之有效的算法。
对于不均衡数据分类问题有一系列方法陆续被提出,这些方法可以分为算法层面和数据层面。算法层面包括代价敏感[1]、特征选择[2]和集成学习方法。在不均衡分类问题中人们通常更关注少数类,因此少数类才是不均衡分类的关键。针对不均衡数据中样本重要性不同的特点,代价敏感学习给予各类别不同的错分代价。例如在二分类问题中给予少数类更高的错分代价,迫使分类器对少数类取得较好的识别效果。特征选择方法在用于不均衡分类问题同样取得较好的效果。如果数据集中不同类别样本分布不均衡,则特征分布也可能会不均衡。因此选取最具有区分度的特征不仅可以降低复杂度,还有助于提高少数类的识别精度。……
登录APP查看全文
