C4.5决策树算法在医疗数据分类中的应用研究
2021-06-28郭星晨王青青
安庆师范大学学报(自然科学版) 2021年2期
郭星晨,王青青,王 亚
(阜阳师范大学计算机与信息工程学院,安徽阜阳 236037)
分类算法旨在一群已知标签的数据样本中训练出一种分类模型,发现数据之间的规则与联系,区分数据类别并进一步预测数据的未来发展。目前,常见的分类算法有决策树算法、Logistics回归算法和支持向量机算法等[1-3],这些分类算法已广泛应用于互联网、医疗、金融等行业[4-9]。在医疗行业里,利用决策树算法建立模型,分析病案数据之间的关联规则以及疾病指标的变化规律,能够为医生提供极具价值的信息,加速医生诊断过程的同时,还能够帮助医生提高决策诊断的准确率,优化传统的医疗方案,进一步推动智能医疗的发展。与其他常规分类算法相比,决策树算法具有易于理解、计算复杂度较低、训练速度快、决策结果可视化等优点,适用于多种数据样本的分类。本文使用C4.5决策树算法对乳腺癌临床数据集进行实验,并对部分数据进行预测,以辅助医疗判断。
1 决策树相关理论
决策树算法包含结点划分属性的选择、树的构建、树的剪枝3个阶段。在属性的选择上,主要以信息增益(Information Gain)[10]、信息增益比(Gain Ratio)[11]和基尼指数(Gini Index)[12]作为选取标准。
假设当前样本集合为O,信息熵(Information Entropy)用于度量数据样本中信息混乱的程度[13],即O的纯度,公式为

其中,p(xi)表示O中第i类样本xi所占的比例(i=1,2,3,…,m)。E(O)越小,样本集合O的纯度越高。
样本特征在其中一个属性c上有N个可能取值,每个可能取值对应了样本集合中的一小群样本Ok,k∈{1,2,3,…,N},计算出Ok的信息熵E(Ok),则该属性c的信息增益可表示为……p>
登录APP查看全文
