APP下载

代价敏感的KPCA-Stacking不均衡数据分类算法*

2021-04-06曹婷婷张忠林

计算机工程与科学 2021年3期
关键词:分类

曹婷婷,张忠林

(兰州交通大学电子与信息工程学院,甘肃 兰州 730070)

1 引言

不均衡数据大规模存在现实生活中且在许多领域有着重要应用,如医疗健康诊断、信用欺诈和 入侵检测[1 - 3]等。通常人们更加关注的是诊断异常或者错误的数据,对于不均衡数据分类问题,少数类的错分代价相对较大,传统的分类方法旨在最大化整体分类准确率,给研究带来了一定的挑战。

国内外学者对不均衡数据分类问题的研究主要从数据层面和算法层面2个大的方面展开。数据层面主要以欠采样、过采样、人工合成采样、混合采样以及相应的改进算法作为研究点,其主要思想是对数据分布进行重构,使数据达到基本均衡状态,如SMOTE(Synthetic Minority Oversampling TEchnique)[4]、Borderline-SMOTE[5]等。算法层面一般集中在集成学习、代价敏感学习CSL(Cost Sensitive Learning)[6]和元学习方面。集成学习主要包括Bagging、Boosting和Stacking算法。代价敏感学习CSL的基本思想是在非均衡数据分类中正确识别出少数类样本的价值比正确识别出多数类样本的价值要高,因此在分类中应赋予样本不同的损失代价。文献[7]基于贝叶斯风险最小化原理提出了一种可以将任意分类器算法转化为代价敏感算法的 MetaCost算法,根据样本属于每个类的概率及误分类代价之积选取分类代价最小的类别作为样本分类结果,从而达到误分代价最小。目前,学者们对一些传统的分类算法,如支持向量机SVM(Support Vector Machine)、决策树、神经网络和 AdaBoost 等提出了对应的代价敏感算法[8 - 11]。王莉等人[12]在代价敏感的理论基础上提出……

登录APP查看全文

猜你喜欢

分类
分类算一算
垃圾分类的困惑你有吗
星星的分类
我给资源分分类
垃圾分类,你准备好了吗
按需分类
教你一招:数的分类
说说分类那些事
给塑料分分类吧