随机森林的可解释性可视分析方法研究
2021-03-23杨晔民张慧军张小龙
计算机工程与应用 2021年6期
杨晔民,张慧军 ,2,张小龙
1.太原理工大学 信息与计算机学院,山西 晋中 030600
2.山西传媒学院 融媒技术学院,山西 晋中 030619
传统上,随机森林是通过组合弱学习器(决策树)来进行分类和回归的有监督学习模型。由于其具有高性能,随机森林成为应用广泛的模型之一。虽然随机森林在分类方面具有良好的表现,但是在实际用于数据分析时会面临诸多挑战。首先,随机森林模型的“黑盒子”[1]特性使得模型的构建及预测过程的细节对用户而言都是隐蔽的,用户只能简单地向随机森林模型导入训练集和输入相关参数,对于领域专家而言,并不能理解预测结果背后的原因。其次,虽然自动的“黑盒”模型可以让用户免于交互,认知“减负”,但是可解释性很差,阻碍了用户理解和洞察知识。Breiman等人[2]认为随机森林的性能排名级别是A+,但是可解释性排名级别为F。因此,可解释性为“F级别”的模型无法应用于在对错误预测零容忍或很小程度容忍领域中,比如在医学诊断中,机器学习模型常常被用来帮助医生做治疗决策,当模型预测结果是假阳性或假阴性,这种错误预测方案对患者来说是致命的。目前有一些机器学习模型可视分析的方法[3],然而对于随机模型,缺少有效的可视分析手段,使得该模型难以理解。对于随机森林模型,目前流行解释模型的方法是特征的全局重要性。Krause等人[4]提出了一个可视分析工作流程,利用“实例级解释”来解释单个实例的局部特征相关性度量,帮助数据科学家和领域专家探索、诊断和理解二分类模型做出决策,但该方法对于特征值的变化如何影响预测结果,特征重要性却不能很好的解释。……
登录APP查看全文
