缺失值情况下基于决策树算法的长白山植被识别的研究
2019-01-21付浩海
长春工程学院学报(自然科学版) 2018年4期
张 华,许 骏,付浩海
(1.长春工程学院计算机技术与工程学院,长春 130012;2.长春工程学院科学研究处,长春 130012;3.长白山历史文化与VR技术重构吉林省重点实验室,长春 130012)
0 引言
机器学习是目前最为流行的数据挖掘方法,通过机器学习可以根据已知数据集的属性特征来预测目标数据集的特征,通常可以分为分类问题(classification)和回归问题(regression)。分类问题是将目标数据集中每个实例的结果标记为类别型数据,回归问题是将目标结果标记为连续型数值。决策树(decision tree)是一种常见的机器学习算法系列,本文讲述的就是使用决策树算法在样本集有缺失值的情况下解决一个分类问题,完成对长白山特殊植被的识别。
1 决策树算法原理
1.1 决策树
决策树同数据结构中的树类似,包含一个根结点、若干个内部结点和若干个叶结点,叶节点是不可再分的结点。在决策树中,根结点包含样本全集,中间每个内部结点对应一个属性测试,根据属性取值不同形成不同分支,每个结点包含的样本集合根据属性测试的结果被划分到分支子结点中,叶结点对应最终的决策结果,从根结点到每个叶节点的路径对应了一个判定测试序列,决策树学习的目的是产生一棵泛化能力强的决策树。决策树包含多种算法,每种算法都使用不同的最优划分属性选择依据。ID3算法使用信息增益(information entropy)来划分。
1.2 信息熵和信息增益
一条信息的信息量大小和它的不确定性有直接关系,信息量越小,不确定性越高。……
登录APP查看全文