基于super learner算法的集成学习及其在纵向删失数据预测建模中的应用
2021-03-09杨嵛惠王静娴李业棉陈方尧
杨嵛惠 王静娴 赵 芃 李业棉 陈方尧
西安交通大学医学部公共卫生学院流行病与卫生统计学系卫生统计学教研室,710061 陕西 西安
队列研究是流行病学研究中一种重要的研究类型。在队列研究中,研究人员常会对大量对象进行长期随访,来收集与研究目的相关的信息、记录特定终点事件的发生情况及发生时间[1]。然而,在研究中通常只有一部分个体在随访中发生终点事件,另一部分个体在随访期内并未观测到终点事件的发生,这样的数据称为纵向删失数据(censored data)[2]。而基于删失数据的预测模型,一直是研究人员感兴趣的热点。本文探讨基于super learner算法的集成学习在纵向删失数据预测建模中的应用,为删失数据预测提供参考。
1 数据预测建模中的集成学习
目前,基于机器学习(machine learning)的统计分析技术已广泛应用于生物医学数据的预测建模分析中[3],它是进行自动或半自动信息(知识)获取的有力工具,且利用机器学习算法及相关技术对高维数据进行处理,可对传统的统计分析起到辅助作用。目前,在生物医学高维数据预测建模分析中,应用较多的机器学习算法包括回归学习(regression learning)、正则化算法(regularization)、决策树算法(decision tree)、贝叶斯方法(bayesian method)、核方法(kernel method)、无监督学习(unsupervised learning)和有监督学习(supervised learning)等。
机器学习算法的应用为生物医学数据的处理和分析提供了新的、有利的工具,然而机器学习算法在实践中存在以下2个方面的问题。
(1)不同算法在处理同一个数据时得到的结果不完全一样,即不同算法的预测结果之间存在差异;……
