APP下载

家系数据中罕见基因变异与疾病关联分析的统计方法

2016-04-21阮培峰

复旦学报(医学版) 2016年2期

阮培峰

(复旦大学计算机科学学院 上海 200433)



家系数据中罕见基因变异与疾病关联分析的统计方法

阮培峰△

(复旦大学计算机科学学院上海200433)

【摘要】目的提出一种适应家系数据的序列核关联检验(sequence kernel association test,SKAT)模型,以提高家系数据中检验罕见变异的统计模型的功效。方法提出一种适应家系数据的SKAT模型(adjusted SKAT,ADSKAT),通过对SKAT的原模型进行修改,加入表示家系结构的随机作用向量,使得家系数据中亲属相关性的影响被考虑进模型,并且得出新的检验统计量对应的概率分布。结果在家系数据中,ADSKAT不仅有效地控制了一类错误的增长,并且比现有的识别罕见变异的GWAS统计模型有着更高的统计功效。结论ADSKAT是一种在家系数据中识别与疾病关联的罕见变异的统计模型,具有广泛的应用前景。

【关键词】罕见基因变异;全基因组关联分析 (GWAS);家系数据

全基因组关联分析(genome-wide association study,GWAS)自从2005年被首次应用以来,已经发现并证实了超过2 000个与疾病或者性状关联的基因位点[1]。然而,通过GWAS识别的常见基因变异通常只能解释一小部分的疾病成因和性状遗传。而罕见变异通常指等位基因频率小于0.1%~1%的变异,在疾病和性状的遗传中可以起到非常重要的作用。常规的GWAS只对单个SNP进行检验,这样的方法对罕见基因变异的检验就显得效力不足[2]。针对这个问题,一些新方法被提出,比如Morgenthaler等在2007年[3]、Madsen等在2009年[4]以及Morris等在2010年[5]提出的负荷检验。这些方法将在事先定义的基因区域(例如基因,通路等)中所有罕见基因变异的信息压缩成一个单一的变量,进而进行检验。……

登录APP查看全文