基于随机森林的重要性测度指标体系*
2021-04-09宋述芳何入洋
宋述芳,何入洋
(西北工业大学 航空学院, 陕西 西安 710072)

随机森林(Random Forest, RF)是Breiman于2001年提出的一种统计学习理论方法[7]。首先,通过Bootstrap重采样技术从原始样本集中抽取多个训练样本集,然后再利用抽取的样本集建立相应的决策树,并组建随机森林。随机森林应用广泛,不仅可以处理分类、回归问题,对于降维也有很好的适用性。随机森林对异常值与噪音也有很好的容忍度,稳健性强,不容易出现过拟合,被Iverson誉为当前最好的算法之一[8]。现有的基于随机森林的重要测度指标主要有两种:基于Gini指数的平均不纯度减少指标(Mean Decrease Impurity, MDI)和基于袋外(Out-Of-Bag, OOB) 数据置换的平均精确率减少指标(Mean Decrease Accuracy, MDA)[9-11]。基于Gini指数的MDI指标对离散特征存在偏向性,且重要性分析结果与特征变量的选择顺序有关[12-13]。基于OOB数据置换的MDA指标则可以直接度量每个特征变量对模型精确率的影响程度,不存在偏向问题,应用广泛。此外,基于OOB数据置换的MDA指标求解过程与基于方差的全局灵敏度分析的单层Monte Carlo模拟法相似,可由此作为切入点寻找两者之间的关系。
本文通过比较基于方差的全局灵敏度指标和基于OOB数据置换的MDA指标的求解过程,寻找两者之间的关系,并进一步建立基于随机森林的重要测度指标体系,包括单变量测度指标、组变量测度指标等,可为后期复杂环境、高维小样本数据的重要性测度分析奠定基础。
1 基于方差的全局灵敏度指标
由Sobol′提出的基于方差的全局灵敏度指标能够反映输入变量在整个变化范围内对输出响应方差的影响程度。……
