基于簇内样本平均分类错误率的混合采样算法
2021-08-24熊炫睿陈高升程占伟付明凯
小型微型计算机系统 2021年8期
熊炫睿,陈高升,熊 炼,张 媛,程占伟,付明凯
1(重庆邮电大学 通信与信息工程学院,重庆 400065)
2(重庆工程学院,重庆 400056)
1 引 言
分类学习是机器学习的重要研究方向之一,许多实际应用中存在类别分布不平衡的数据,即数据集中不同类别的样本数量相差很大的情况,例如入侵检测、医疗检测、信用卡欺诈等应用场景,少数类样本在这些应用场景中也很重要[1,2].机器学习模型在对类别分布不平衡的数据进行分类时,对少数类的召回率会较低.
现有算法层面的方法和数据层面的方法[3]能提高分类模型对类别不平衡数据的分类效果.算法层面的方法包括代价敏感学习方法和集成学习等方法.数据层面的方法有欠采样方法、过采样方法与混合采样方法.欠采样方法通过减少多数类样本使数据达到平衡,例如各种基于聚类的欠采样算法以及随机欠采样算法.过采样方法通过增加少数类样本使数据达到平衡,例如SMOTE算法.混合采样方法将过采样方法与欠采样方法相结合,通过对少数类样本采用过采样方法提高数据量,对多数类样本采用欠采样方法降低数据量,将不平衡数据转化为平衡数据集.
近年来,许多学者对SMOTE算法进行了改进优化.燕昺昊等人通过改进的SMOTE算法增加少数类样本数量,用得到的平衡数据集训练一个深度循环神经网络分类器,对少数类的召回率显著地得到提高[4].陈虹等人提出一种改进的SMOTE算法—基于最大相异系数密……
登录APP查看全文
