APP下载

基于Xgboost和Keras框架的多疾病风险预测

2020-03-18席欢欢

智能计算机与应用 2020年9期
关键词:特征方法模型

黄 旭, 贺 松, 席欢欢, 张 硕, 张 慧

(1 贵州大学 大数据与信息工程学院, 贵阳 550025; 2 贵州大学 医学院, 贵阳 550025)

0 引 言

随着计算机技术广泛应用于医疗领域,医院信息化建设得到快速发展。医院信息系统中存储了大量的数据资源,运用数据挖掘技术可以有效的分析、整合和利用这些数据,以达到辅助诊疗的目的。利用数据挖掘技术对疾病风险预测,对疾病的管理、预防、干预等有着重要意义。

慢性病非传染性疾病通常具有发病潜伏期长、病因复杂、反复发作、难以彻底治愈的特点,导致的负担占总疾病负担的70%以上,成为制约健康预期,寿命提高的重要因素[1]。因此,在慢性病还没有显现时,就应当做好疾病的预测,提前发现,及时处理,将疾病的影响降到最低。利用数据挖掘技术,找出慢性病发生直接或者间接的危险因素,就能够通过监测这些因素,及时采取预防措施,从而降低发病率。

1 理论方法

1.1 分类算法

集成学习本质上是通过学习并结合多个弱分类器来获得比单一分类器优越的泛化性能[2]。RF、GBDT和Xgboost的弱学习器都是树模型,利用多棵决策树对样本数据训练、分类和预测。在对数据分类时,给出各特征的重要性得分,评价各特征在分类中的作用。

随机森林(Ramdom Forest,RF)是一种基于Bagging算法改进的模型,做分类时,各弱分类器之间无强依赖关系,相互独立,每一个弱分类器都有一个分类结果,最后根据森林内决策树投票,按照少数服从多数的原则,对最终结果进行判定。随机森林具有二个特点:数据随机和特征随机。……

登录APP查看全文

猜你喜欢

特征方法模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
不忠诚的四个特征
3D打印中的模型分割与打包
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼
线性代数的应用特征