一种融合集成思想的不平衡数据分类方法
2021-09-28强冰冰
软件导刊 2021年9期
强冰冰,尹 红,王 瑞
(昆明理工大学机电工程学院,云南昆明 650550)
0 引言
在实际生产和生活中,广泛存在数据类分布不均衡现象,单一的传统分类器,如神经网络、SVM 等在处理不平衡数据时,往往倾向于多数类,使得少数类的分类效果较差。而在实际应用场景中,如医学诊断[1]、信用卡欺诈检测[2]等,少数类的正确分类具有重要意义,因此,国内外学者从数据和算法的角度对不平衡数据分类进行了研究。
针对不平衡数据在数据层面的处理,以过采样和欠采样方法为代表,通过调节样本类别的比例以达到类平衡;在算法层面,其思路是基于现有算法进行改进,使其能够更好地区分少数类,主要有单类学习[3-4]、代价敏感学习[5-6]和集成学习等。
在数据层面,过采样方法是通过增加少数类的数量以达到样本均衡。传统的随机过采样,在合成样本时具有较大的随机性和盲目性,容易使模型过拟合,于是Chawla[7]提出SMOTE 过采样技术,有效降低了过拟合的风险;SMOTE虽然简单有效,但同时也存在样本合成质量低、边界模糊和类分布不均匀问题[8-9]。为了解决上述问题,文献[10]提出基于K 均值聚类和SMOTE 相结合的K-means SMOTE过采样方法,提高了样本合成质量,克服了类分布不均匀问题,但寻找超参数的最优值往往依赖于经验;文献[11]基于CNN(Condensed Nearest Neighbor)和Tomek-link,提出了一种改进的过采样方法,可以较好地检测出离群点、噪声和冗余样本;文献[12]根据学习困难程度对少数类使用加权分布,考虑到少数类样本的分布特点,提出自适应的合成少数类样本的ADASYN 采样方法;……
登录APP查看全文
