APP下载

双重代价敏感随机森林算法

2021-01-16周炎龙孙广路

哈尔滨理工大学学报 2021年5期

周炎龙 孙广路

摘要:针对分类器在识别不平衡数据时少数类准确率不理想的问题,提出了一种双重代价敏感随机森林算法,双重代价敏感随机森林算法分别在随机森林的特征选择阶段和集成投票阶段引入代价敏感学习。在特征选择阶段提出了生成代价向量时间复杂度更低的方法,并将代价向量引入到了分裂属性的计算中,使其在不破坏随机森林随机性的同时更有倾向性地选择强特征;在集成阶段引入误分类代价,从而选出对少数类数据更敏感的决策树集合。在UCI数据集上的实验结果表明,提出的算法较对比方法具有更高的整体识别率,平均提高2.46%,对少数类识别率整体提升均在5%以上。

关键词:随机森林;不平衡数据;特征选择;代价敏感

DOI:10.15938/j.jhust.2021.05.006

中图分类号:TP181 文献标志码:A 文章编号:1007-2683(2021)05-0044-07

0 引言

随着大数据时代的来临,数据呈现数量多、不平衡等特点,即一个类样本数量远多于另一个类的样本数量[1],如何将其正确的分类是一种重要的数据分析技术。类别不平衡的数据普遍存在于现实生活的许多应用中。例如,用于疾病诊断预测的病历数据中,许多少见却非常重要的疾病样本数远小于正常或常见的疾病样本数[2];用于互联网人侵检测的样本数据中,正常的样本数远多于人侵的样本数。若将传统分类器应用于这些场景而不对类别的不平衡性做任何处理,就会使得多数类淹没少数类(少数类往往是更重要的),得不到好的分类效果。……

登录APP查看全文