基于混合深度神经网络的基因遗传变体致病性注释
2019-08-21杨书新汤达荣
生物学杂志 2019年4期
杨书新, 汤达荣
(江西理工大学 信息工程学院, 赣州 341000)
在全基因组关联研究中已经发现人类的许多疾病和症状与遗传变体相关[1],但由于这些复杂疾病受到多种遗传和环境因素的综合影响,导致鉴定与之相关的遗传变体一直是缓慢且困难的[2]。大部分的遗传变体存在于非编码区,但已有的大部分注释方法是基于蛋白编码区域的变体,并且这些编码区域的基因只占整个基因组的大约2%[3]。近期提出的基于支持向量机(SVM)的联合注释依赖耗尽(CADD)[4]算法,该方法客观地将多种不同注释整合到每个变体的单个度量中。但是CADD中的SVM方法性能受限,由于它只能学到线性的数据特征。
近年来,深度学习[5]成为机器学习最热的方向之一,在图像识别、语音识别和自然语言处理领域取得了突破性进展[6-7],而且在生物信息学中也有不少成功应用[8-11]。深度学习在高通量生物学中潜力巨大,它擅长处理庞大高维的数据,通过训练多层网络学到数据之间的内部结构,对了解生物数据的结构增加了解释性[12-13]。
基于深度学习方法众多的优点,本文设计了一个模型,该模型由3个卷积神经网络和4个全连接神经网络构成。卷积网络擅长于数据的降维和特征提取[14],它的另一个优点是权值共享,大大地减少了网络中的参数。全连接网络充当一个分类器。使用训练集训练模型,使用模拟和真实的测试集评估模型的预测准确率,以期能很好地捕获特征之间的非线性关系。……
登录APP查看全文
