利用K均值聚类算法识别遗传疾病致病SNP位点
2021-01-07张恒益郑惠玲
家畜生态学报 2020年12期
张恒益,郑惠玲
(西北农林科技大学 动物科技学院,陕西 杨陵712100)
生物医学研究表明,许多疾病都有相应的致病基因或易感基因。复杂疾病往往由基因变异引起,但致病基因的精确定位却不易做到[1-2]。在组成DNA的碱基对中,一些特定位置的单核苷酸发生变异引起的DNA多态性称为SNP (Single Nucleotide Polymorphism)位点。SNP是最常见的基因变异类型,识别致病SNP位点对精确定位致病基因具有重要意义。Pico等[3]通过识别致病SNP位点找到了孟德尔疾病的缺陷基因;Irina等[4]发现了克罗恩(Crohn)疾病相关的致病位点;Pernille等[5]发现了一些与情感信号传导障碍相关的SNP位点。牛蜘蛛腿综合征是一种以骨骼畸形为病理特征的先天致死性遗传病,该病有两个致病位点[6]。另外还有许多家畜遗传疾病是由致病位点或基因引起,如肢蹄畸形、血友病、鸡的卷羽、猪的应激综合征等[7]。
近年来,人们提出了许多识别致病SNP位点的方法[8-15],其中性能优异的逻辑斯蒂回归及随机森林算法目前被普遍使用[13]。逻辑斯蒂回归是一种广义线性回归分析模型,解决了线性回归模型不适用因变量为离散值的问题,目前在疾病诊断、经济预测等领域应用广泛。随机森林是一个包含多个决策树的集成分类器,可显著提升模型的精度及泛化性能。但是,以上两种方法有一个共同的缺点是计算复杂度比较高,不适合实时处理数据量庞大的高维基因数据集。基于此,本文提出了利用K均值聚类算法识别遗传疾病致病SNP位点的新算法,为实时处理大规模畜禽基因数据集提供参考。……
登录APP查看全文
