改进随机森林算法综述
2019-10-21孙明喆毕瑶家孙驰
孙明喆 毕瑶家 孙驰



摘 要:随机森林是一种灵活且易于使用的机器学习算法,因为它很简易,既可用于分类也能用于回归任务。在医学、生物信息、环境预测检测等领域有着广泛的应用。为此,本文介绍了随机森林原理及其相关性质,以及它的改进情况及应用,并讨论了以后的改进趋势和方向。
关键词:随机森林;决策树;集成学习;机器学习
中图分类号:TP311.13;TP181 文献标识码:A 文章编号:2096-4706(2019)20-0028-03
Abstract:Random forest is a flexible and easy-to-use machine learning algorithm,because it is very simple and can be used for both classification and regression tasks. It has been widely used in the fields of medicine,bioinformatics,environmental prediction and detection. In this paper,the principle of random forest and its related properties,its improvement and application are introduced,and the future improvement trend and direction are discussed.
Keywords:random forest;decision tree;integrated learning;machine learning
0 引 言
随机森林(Random Forest)是一种比较新的机器学习模型。近十几年来,随机森林得到了迅速的发展,在生物信息领域,Chen等[1]利用随机森林算法蛋白质的相互作用进行了研究;Smith等[2]利用判别分析法与随机森林算法对细菌源追踪数据进行了对比研究。在经济管理领域,Ying等以银行客户的数据为例,运用随机森林算法研究了客户流失情况。此外,随机森林在生态学、经济学[3]、医学领域[4]、刑侦领域[5]和模式识别领域取得了较好的效果。
随机森林算法存在先天性不足主要表现在对数据分类的性能不足。黄衍等人[6]对比随机森林和支持向量机在处理非平衡数据时的性能之后,得出了随机森林算法在处理非平衡分类数据时其性能显著逊色于支持向量机的结论。目前,中国对随机森林的改进研究还是非常少,因此,系统的整理总结随机森林最新的改进与应用情况对接下来的改进很有意义。
1 随机森林原理与性质
1.1 原理
随机森林通过Bootstrap技术,从原始训练集样本集N中有放回地重复随机抽取k个样本生成新的训练样本集合,根据样本集生成k個决策树,并且随机组合得到随机森林,新数据的分类结果按决策树投票多少形成的分数而定;D是样本集,D1,D2,Dk分别是每次随机抽样后生成的决策树。……
