基于KPCA-LightGBM 的心脏病预测研究
2021-09-28张云华
软件导刊 2021年9期
黄 嵩,张云华
(浙江理工大学 信息学院,浙江杭州 310018)
0 引言
根据世界卫生组织的报告,心脏病每年导致全球数百万人死亡[1]。引发心脏病的因素有很多,如工作压力过大和生活作息不规律等。中国作为世界人口第一大国,约有两亿多人患有不同程度的心脏病[2]。近年来,中国心脏病发病呈年轻化趋势[3]。与此同时,我国地区经济发展不平衡,公共医疗资源也严重不足。在这样的社会背景下,开发出一个能从病人的病历信息中筛选出有效信息,并协助医生作出心脏病诊断的算法具有非常高的现实价值[4]。
在国外,早在1976 年,斯坦福大学的Wraith 等[5]就开发出了MYCIN 系统,可以帮助医生对患者进行诊断,但由于早期的计算机计算性能有限,MYCIN 系统的准确性有限,功能也比较匮乏。近年来,随着机器学习的发展,可以通过计算机技术手段挖掘病人病历中的信息,在病历数据中找出疾病相关信息,并利用这些信息建立疾病预测模型[6]。苗立志等[7]使用支持向量机和随机森林实现了对乳腺癌的风险分析和预测;苗丰顺等[8]使用随机森林和XG⁃Boost 实现了糖尿病的风险预测;赵颖旭等[9]使用LightGBM对老年痴呆住院费用进行预测;Amin 等[10]使用支持向量机完成了对心脏病的预测。
本文基于已有研究,针对病历数据维度高的问题,首先对病历数据进行降维[11]。传统的主成分分析(PCA)方法是假设数据集中各特征是线性无关的,主要通过计算方差寻找不同特征之间的线性组合。而在很多应用场景下,线性映射很难得到想要的结果,核主成分分析(KPCA)通过核函数的思想获得了更好的特征提取性能。……
登录APP查看全文
