基于属性纯度的决策树归纳算法
2021-01-20姚岳松张贤勇
计算机工程与设计 2021年1期
关键词:分类
姚岳松,张贤勇+,陈 帅,邓 切
(1.四川师范大学 数学科学学院,四川 成都 610066;2.四川师范大学 智能信息与量子信息研究所,四川 成都 610066)
0 引 言
决策树模型是基于规则的分类方法的典型代表,广泛应用于医疗、社会学、金融等领域[1-6]。决策树通常有两类构造算法。一类是基于信息熵的算法,例如经典的ID3算法[7]和C4.5算法[8],以及C4.5的改进算法[9-11]、ID3的改进算法[12]。粗糙集理论能够进行规则提取与知识获取,其中的属性重要度是依赖性推理的核心度量[13]。由此,基于属性依赖度的特征选择提供了决策树构造的另外一类方法,即基于粗糙集的算法[14-16]。
属性依赖度来源于下近似集成的分类正域[13],由于要求条件粒完全包含于决策类,使得基于粗糙集的决策树模型抗噪能力不强。实际数据环境下,条件粒存在不协调于决策类的情况,从而基于粗糙集的决策树模型通常需要结合信息熵函数。关于特征选择的节点度量函数,信息熵刻画不确定性结构的信息,属性依赖度与粒度推理的代数表示有关;两种机制的异质性降低了分类效果。对于分类精度而言,属性依赖度源于分类正域的定性特征,其本质是分类精度的定性和绝对度量。因此,本文首先提出了一种定量的分类准确度指标——属性纯度,而相关的特征选择对分类精度也是有效的。进而,基于属性依赖度与属性纯度的同质异态性,采用“属性依赖度优先、属性纯度补充”的二级选择策略,建立一种新的决策树归纳算法,改进基于粗糙集的决策树算法。……
登录APP查看全文
