APP下载

使用离散增量结合支持向量机方法预测蛋白酶的类型

2021-05-13

农业与技术 2021年8期
关键词:方法

王 婷

(长治职业技术学院,山西 长治 046000)

本文使用chou和shen相同的数据库[3],从蛋白酶的一级序列出发,以氨基酸组分,氨基酸二肽组分和亲疏水三肽组分为参数,采用离散增量结合支持向量机(ID-SVM)的方法对蛋白酶的类型进行预测,获得了较好的预测效果。

1 材料和方法

1.1 数据来源

本文选取了chou和shen创建的蛋白酶数据库[4](http://merops.sanger.ac.uk/(version 8.1,released on 05-May-2008))。此数据库的特点:序列同源性小于25%;序列长度不小于50个氨基酸;去除所有含有未知残基的序列。基于以上标准,最终得到3051个蛋白酶序列,可以分为6个类型:258个丝氨酸蛋白酶(aspartic)序列;589个苏氨酸蛋白酶(cysteine)序列;39个半胱氨酸蛋白酶(glutamic)序列;1040个天冬氨酸蛋白酶(metallo)序列;1063个金属蛋白酶(serine)序列;62个谷氨酸蛋白酶(threonine)序列。本文以这6类蛋白酶的一级结构为研究对象。

1.2 特征参数

1.2.1 氨基酸n肽组分

肽是构成蛋白质的结构片段,也是蛋白质发挥作用的活性基础部分。当n=1时,氨基酸n肽组分就退化为氨基酸组分,即20种氨基酸出现的频数,其表达相对简单,但丢失了各氨基酸间的关联信息。当n=2时定义为二肽组分,即400种氨基酸二联体出现的频数,此时加入了氨基酸间的排列次序和关联信息[5]。以此类推,n个氨基酸缩合成的n联体就称为n肽组分。

1.2.2 氨基酸序列的亲疏水性分布

蛋白质是由20种不同的氨基酸组成的生物大分子,蛋白质分子中的氨基酸残基靠酰胺键连接,形成含多达几百个氨基酸残基的多肽链,不同类型的氨基酸所包含的侧链结构和性质也各不相同,因此类型不同的氨基酸具有不同的物理化学性质。……

登录APP查看全文

猜你喜欢

方法
中医特有的急救方法
高中数学教学改革的方法
化学反应多变幻 “虚拟”方法帮大忙
变快的方法
学习方法
用对方法才能瘦
最有效的简单方法
四大方法 教你不再“坐以待病”!
赚钱方法
捕鱼