基于Bagging集成学习的蛋白质折叠识别
2021-12-17杨欣华顾海明
青岛科技大学学报(自然科学版) 2021年6期
杨欣华,顾海明
(青岛科技大学数理学院,山东青岛266061)
蛋白质在生物体的生命活动中起着非常重要的作用,而蛋白质的功能取决于蛋白质折叠以及与其他蛋白质的相互作用[1]。蛋白质折叠识别是从蛋白质的氨基酸序列中得到蛋白质的三级结构而不依赖于蛋白质序列的相似性[2]。在人体中蛋白质会发生折叠错误而引起很多的疾病。而深入了解蛋白质折叠对于这些疾病的致病机制,阐明蛋白质错误折叠的各种因素将有助于医学研究和医学药物的研发。但目前的试验方法的代价高,而计算方法具有比实验室方法更便宜更快的优点,现在普遍用于蛋白质折叠识别[3]。目前对蛋白质折叠的研究是根据蛋白质主要结构信息将蛋白质进行分类,由此得到已知的蛋白质折叠类型[4]。基于分类的方法就是基于各种蛋白质结构分类数据库中的数据运用机器学习方法对蛋白质进行结构分类。
目前得到所需要的蛋白质折叠信息主要是是通过机器学习,从蛋白质序列出发对蛋白质折叠模式的分类。常用的数据库有蛋白质结构分类数据库SCOP(structural classification of protein,SCOP)数据库[5]。其中SCOP 数据库包括蛋白质结构类、折叠类型、超家族、家族等不同层次[6],本研究所使用的数据集同样是从SCOP 数据库中选取的。蛋白质折叠识别作为多类分类任务,在该领域中已经有很多基于机器学习方法构建的模型。这些方法中的大多数包含两个阶段:1)特征提取;2)分类算法[4]。
对于特征提……
登录APP查看全文