病例队列设计下加性风险回归分析及其在乳腺癌数据中的应用
2021-05-28丁洁丽
杨 杰,丁洁丽
(武汉大学数学与统计学院,湖北武汉,430072)
1 引言
生存数据应用在许多学科领域,如生物医学、流行病学、公共卫生学、可靠性工程学、经济学和保险精算学等领域.生存分析主要研究某特定事件的发生时间(例如:死亡时间、疾病发生时间、系统失效时间、索赔时间等等)与重要影响因素和协变量之间的关联.对于生存数据的研究,比例风险模型是应用最为广泛的统计半参数模型之一(Cox,1972[1];Andersen&Gill,1982[2];Lin,1994[3];Chen&Little,1999[4];Kalb fleisch&Prentice,2002[5]等等).作为比例风险模型的一个重要替代,加性风险模型假设基准风险函数与协变量效应之间具有一个加性结构.在很多实际应用中,加性风险模型往往能更好地拟合数据(Lin&Ying,1994[3];Mckeague&Sasieni,1994[6]).而当加性风险模型和比例风险模型均能较好地拟合数据时,加性风险模型的回归参数更容易解释其实际意义(Lin&Ying,1994[3];Zeng&Cai,2010[7]).
在许多大型队列研究中,往往涉及对大量研究个体的长期追溯和随访.当重要影响因素或协变量的采集非常昂贵时,采用传统的简单随机抽样可能会导致实验过于昂贵而超过预算.因此,发展和研究能节约成本和提高效率的抽样机制具有非常重要的意义.对于带有删失的生存数据,病例队列设计(Case-Cohort design)是应用最为广泛的有偏抽样机制之一.其主要机制是:首先,从全队列中随机地抽取一个子队列(subcohort),全队列中所有发生了感兴趣事件的个体称为病例(case).然后,子队列和子队列之外所有的病例组成病例队列样本.最后,仅对病例队列样本中的个体进行昂贵协……
