基于聚类的多样本复发拷贝数变异检测算法
2021-08-24陈念华袁细国
陈念华,袁细国
(西安电子科技大学 计算机科学与技术学院,陕西 西安 710071)
0 引言
拷贝数变异(Copy Number Variation,CNV)是人类基因组中一种重要的结构变异类型,长度通常在1K base pairs (bp)到3Mbp之间,包括拷贝数扩增(amplification)和拷贝数缺失(deletion)两种类型[1, 2]。人类基因在正常情况下是二倍体,所以对于人类基因组来说,拷贝数扩增是指基因组区域的拷贝数从正常二倍体到多倍体的变化,拷贝数缺失则是基因组区域中拷贝数减少的变异,若拷贝数缺失至单倍体,称作杂合性缺失;若拷贝数缺失至0,则称作纯合性缺失.研究表明,CNV在人类基因组中十分常见,它会引起基因表达发生异常,与人类复杂疾病紧密关联,例如自闭症[3]、精神分裂症[4]、自身免疫性疾病[5]以及癌症[6]等疾病。
自1975年第一代DNA测序技术开创至今,人类已经积累了大量的测序数据,这使得利用计算机技术对这些数据进行分析成为可能。相比于直接用医学手段检测CNV,利用计算机技术检测CNV更加便捷,成本也十分低廉。当下检测CNV的主要难点在于如何区分驱动CNV[7]和随机CNV。所谓驱动CNV,是指对疾病有直接影响或者关联较大的CNV,找出驱动CNV对理解疾病的发病机理有很大帮助;随机CNV则是指在基因中随机出现、与疾病的发生关联不大的CNV。在多样本检测[8]的前提下,CNV按照在不同样本中发生的频率不同可以分为复发CNV[9]和个体CNV[10],其中复发CNV指在不同患者基因组中相同位置发生的CNV,而个体CNV在不同患者基因组中发生的位置则是随机的.研究表明,复发CNV更有可能是驱动CNV,即更有可能包含疾病相关基因,因此本文算法的目标就是从多样本数据中检测出复发CNV。……