APP下载

一种非平衡数据分类的过采样随机森林算法

2019-04-15赵锦阳卢会国蒋娟萍袁培培柳学丽

计算机应用与软件 2019年4期
关键词:分类区域

赵锦阳 卢会国,2 蒋娟萍,2 袁培培 柳学丽

1(成都信息工程大学电子工程学院 四川 成都 610225) 2(中国气象局大气探测重点开放实验室 四川 成都 610225) 3(电子科技大学航空航天学院 四川 成都 611731) 4(南京财经大学信息工程学院 江苏 南京 210000)

0 引 言

随机森林RF[1]比单个决策树分类器有较高的分类精度和较低的预测误差,其适合多种环境,不需要剪枝,对噪声数据不敏感等众多优点,已在众多领域得到了广泛的应用;但和其分类器一样,数据集的非平衡程度会很大地干扰分类器的分类。在现实生活中,非平衡数据的少数类样本往往受到广泛关注,例如在金融欺诈领域,不安全的数据信息所占的比例很小,然而这些很少的数据会造成重大的后果[2]。因此对非平衡数据的准确分类已成为重要话题,如何提高随机森林对非平衡数据集的分类精度已受到业界人士的广泛关注。

黄衍等[3]通过比较随机森林和支持向量机在非平衡数据集分类问题上的性能,得出支持向量机在处理非平衡数据集要优于随机森林。根据随机森林的构造过程可知其对非平衡数据集分类差的原因在于随机森林使用Bagging随机选取训练集,因为原训练集为非平衡数据集,故少数类有较低的选中概率,进行多次循环之后,被选中的少数类势必与原始数据集的少数类在数量上有较大差别,这样使得训练出的森林过于依赖多数类样本,失去了代表性。对于面向非平衡数据集的随机森林,如何提高少数类样本被选中的概率,是优化森林算法的关键所在。……

登录APP查看全文

猜你喜欢

分类区域
永久基本农田集中区域“禁废”
分类算一算
垃圾分类的困惑你有吗
分割区域
教你一招:数的分类
关于四色猜想
分区域
给塑料分分类吧
基于严重区域的多PCC点暂降频次估计
区域