WKMeans 与SMOTE结合的不平衡数据过采样方法
2021-12-12陈俊丰郑中团
陈俊丰,郑中团
上海工程技术大学 数理与统计学院,上海 201620
不平衡数据分类问题目前已成为机器学习与数据挖掘的研究热点之一。现实世界中大多数数据是不平衡的,即多数类样本个数显著大于少数类样本个数,由于传统的机器学习方法仅适用于样本数量均衡的数据集上,因此不平衡数据无法适用。在医疗诊断[1]、信用欺诈[2]等领域,数据集往往是不平衡的,人们关注的多是少数类样本,将少数类样本错误分类为多数类样本可能会带来严重的后果,因此,提高少数类样本分类的准确率是现今的研究热点之一。
目前,解决不平衡数据分类问题的方法大致有两类,一类是基于数据层面的方法,另一类是基于算法层面的方法。随机欠采样(Random Under-sampling)[3]和随机过采样(Random Over-sampling)[3]是两种最简单的处理不平衡数据的方法[3]。但是,随机欠采样和随机过采样面临着可能剔除样本内重要信息和过拟合的问题,因此不同学者提出了不同的采样方法[4-7]。其中,最为经典且常用的方法是SMOTE[4](Synthetic Minority Oversampling Technique)方法。该方法通过对少数类样本进行插值生成新的样本,但该方法选择所有少数类样本来生成新样本,存在着一定的盲目性。基于算法层面的方法主要通过改进传统分类算法,使其能够应用在不平衡数据集上,常见方法包括集成学习[8-10]和代价敏感学习[11]。
聚类算法是一种无监督的分类算法,其中K均值算法[12](K-means)是一种最为简单而又常见的聚类算法。传统的K-means算法在聚类的过程中平等对待所有的特征,然而在现实生活中,不同特征对不同数据集的聚类效果影响不同,因此不同学者针对该问题提出了不同的特征加权方法[13-14]以处理特征对最终聚类结果的影响。……
