APP下载

Spark环境下基于综合权重的不平衡数据集成分类方法

2019-02-15丁家满王思晨贾连印游进国

小型微型计算机系统 2019年2期
关键词:分类实验方法

丁家满,王思晨,贾连印,游进国,姜 瑛

(昆明理工大学 信息工程与自动化学院, 昆明 650500)

1 引 言

随着大数据时代的到来,数据正以前所未有的速度在不断地增长和积累.数据在各个领域的应用价值比以往任何时候都重要.如何高效、准确地从数据信息中挖掘有价值的信息引起了学者们的广泛关注.然而现有的这些数据具有多样性和复杂性以及数据分布严重不平衡等特点, 经常会遇到许多大规模的多类别不平衡数据分类问题,如文本分类[1]、疾病诊断[2]以及图像分类[3]等.然而传统分类算法在处理不平衡数据时少数类样本分类准确率过低从而导致分类器的整体性能下降[4].因此选择合适的技术提高少数类样本的占比,提高对少数类的分类准确率以及分类器的整体性能显得尤为重要.目前有诸如改变数据的分布和改进已有分类算法等方式试图从不同的角度解决上述问题,也取得了较好的成效[ 5-7].其中改变数据的分布来达到数据平衡最常见的策略有随机过采样(over-sampling)、随机欠采样(under-sampling).随机过采样是对少数类的样本进行复制使数据集的样本数达到平衡,随机欠采样则以一定的策略选取多数类样本中的一个子集达到同样的目的. 李克文等人[8]提出基于RSBoost算法的不平衡数据分类方法,该方法采用 SMOTE 算法对少数类进行过采样处理,然后对整个数据集进行随机欠采样处理来改善整个数据集的不平衡性,提高少数类的分类准确性……

登录APP查看全文

猜你喜欢

分类实验方法
记一次有趣的实验
分类算一算
做个怪怪长实验
教你一招:数的分类
NO与NO2相互转化实验的改进
实践十号上的19项实验
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼