APP下载

改进无监督极限学习机的不平衡数据分类

2018-02-13陈金琼

安徽师范大学学报(自然科学版) 2018年6期
关键词:分类模型

徐 昌, 陈金琼, 周 文

(安徽师范大学 数学与统计学院,安徽 芜湖 241002)

引 言

近年来不平衡数据分类[1]在分类领域占有越来越重要的地位,严重不平衡的案例极有可能出现在决定性问题中,左右问题处理的走向,从而影响处理的结果。同等分布的数据在预测中是强制的,以避免错误分类[2]。然而,不平衡现象一直是预测问题的主要障碍之一[3]。Wang等人[4],不平衡数据集创建了不精确的分类模型,特别是对于少数类。此外,Provost等人进行的一项研究[5],指出数据集的比例从一个类到另外一个类可以是一万到十万。之前的一些关于不平衡数据的研究已经开展。不平衡数据的影响出现在电信风险管理[6]、石油泄漏研究[7]、文本识别[8]、蜂窝通信中的欺诈特征[9]和电子垃圾邮件等问题[10]。

为了克服不平衡的数据问题,已经进行了几项早期研究。Batista等人[11]使用一种方法来减少主体群体并增加较小群体,Cristianini等人[12]对类的权重进行了微调,Chawla等人[13]提出一种少类样本合成过采样技术(Synthetic Minority Oversampling Technique,SMOTE)。SMOTE识别难以学习的小类样本数据并剔除,然后根据训练小样本点与最近聚类中心的欧氏距离为其赋予权重,最后按照采样率从小类样本数据中生成合成新样本数据。

模糊c均值聚类(FCM)是一种广泛使用的不平衡数据问题算法。Jain等人[14]基本是研究聚类在没有指定的输出标签的情况下,实现数据的模型构建。FCM是使用隶属度函数确定数据集中每个样本点属于某个聚类程度的一种聚类方法,其中一项研究将基于FCM的算法应用于不平衡数据分类[15]。……

登录APP查看全文

猜你喜欢

分类模型
一半模型
分类算一算
垃圾分类的困惑你有吗
重尾非线性自回归模型自加权M-估计的渐近分布
教你一招:数的分类
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
给塑料分分类吧
一个相似模型的应用