基于Spark和随机森林优化的糖尿病预测
2021-11-05辽宁工业大学电子与信息工程学院杨雨含安国家
电子世界 2021年17期
辽宁工业大学电子与信息工程学院 杨雨含 安国家
在非平衡数据的问题上,我们实验发现随机森林无法很好的解决这一问题。本文采用了SMOTE算法,能够有效的减少和降低数据集的非平衡性。在面对医疗数据高度特征冗余的特点上,该方案使用了基于随机森林和序联合搜索的Wrapper式特征选择算法。在构造随机树时,该方案使用了Spark实现随机树的并行构建,提高了运行速率。通过对随机森林优化后的模型与随机森林、K最近邻、神经网络和向量机等模型进行对比,实验结果表明,随机森林优化算法的精度达到81.13%,优于其他的4种分类模型。
随机森林是一种先进的机器学习模型,近些年得到快速发展,并广泛应用在医疗、经济学、生态学等领域。但是在实际上,随机森林算法存在数据分类不足等问题。有许多的学者在随机森林算法上做了深入的研究,如俞孙泽在对随机森林算法优化改进的分析一文中提出了使用粗糙集的方法对随机森林特征选择上进行优化。Vakharia等先用ReliefF算法计算特征的权重,删除低于权值的特征后再进行随机森林训练,有效地提高了诊断的准确率。庞泰吾等人用连续特征离散化的方法来改进随机森林的性能。
为了更好的对糖尿病数据集进行预测分析,本文提出了性能更加突出的随机森林优化算法并结合Spark并行计算,可以在提高预测准确率的基础上大大提升算法的效率。
1 随机森林算法
1.1 决策树
决策树被广泛认为可能是基于机器深度学习的一个分类器。……
登录APP查看全文
