APP下载

随机森林的可解释性可视分析方法研究

2021-03-23杨晔民张慧军张小龙

计算机工程与应用 2021年6期
关键词:可视化特征用户

杨晔民,张慧军 ,2,张小龙

1.太原理工大学 信息与计算机学院,山西 晋中 030600

2.山西传媒学院 融媒技术学院,山西 晋中 030619

传统上,随机森林是通过组合弱学习器(决策树)来进行分类和回归的有监督学习模型。由于其具有高性能,随机森林成为应用广泛的模型之一。虽然随机森林在分类方面具有良好的表现,但是在实际用于数据分析时会面临诸多挑战。首先,随机森林模型的“黑盒子”[1]特性使得模型的构建及预测过程的细节对用户而言都是隐蔽的,用户只能简单地向随机森林模型导入训练集和输入相关参数,对于领域专家而言,并不能理解预测结果背后的原因。其次,虽然自动的“黑盒”模型可以让用户免于交互,认知“减负”,但是可解释性很差,阻碍了用户理解和洞察知识。Breiman等人[2]认为随机森林的性能排名级别是A+,但是可解释性排名级别为F。因此,可解释性为“F级别”的模型无法应用于在对错误预测零容忍或很小程度容忍领域中,比如在医学诊断中,机器学习模型常常被用来帮助医生做治疗决策,当模型预测结果是假阳性或假阴性,这种错误预测方案对患者来说是致命的。目前有一些机器学习模型可视分析的方法[3],然而对于随机模型,缺少有效的可视分析手段,使得该模型难以理解。对于随机森林模型,目前流行解释模型的方法是特征的全局重要性。Krause等人[4]提出了一个可视分析工作流程,利用“实例级解释”来解释单个实例的局部特征相关性度量,帮助数据科学家和领域专家探索、诊断和理解二分类模型做出决策,但该方法对于特征值的变化如何影响预测结果,特征重要性却不能很好的解释。……

登录APP查看全文

猜你喜欢

可视化特征用户
基于CiteSpace的足三里穴研究可视化分析
基于Power BI的油田注水运行动态分析与可视化展示
基于CGAL和OpenGL的海底地形三维可视化
如何表达“特征”
“融评”:党媒评论的可视化创新
不忠诚的四个特征
关注用户
关注用户
关注用户
如何获取一亿海外用户