考虑多尺度特征的固有不规则蛋白质预测方法
2012-09-03陈若雷王科俊贺波冯伟兴
陈若雷,王科俊,贺波,冯伟兴
(哈尔滨工程大学 自动化学院,黑龙江 哈尔滨 150001)
功能的重要性使得准确识别固有不规则蛋白质(intrinsically disordered proteins,IDPs)成为目前的研究热点之一[1-2].已公布的IDPs预测模型主要针对长的不规则区域(long disordered regions,LDRs)进行预测,对于短的不规则结构区域(short disordered regions,SDRs)的预测精度较低[3-4].这主要有 2 个原因:1)LDRs与SDRs含有不同的氨基酸组成,利用固定尺度分析IDPs特征不能全面的涵盖不同长度不规则结构区域的信息,造成预测精度降低[5-6];2)SDRs的氨基酸序列较短,包含的信息量较少,为构建特征向量增添了困难[7].
为了有效地解决这一问题,多模型融合成为IDPs预测领域的一个具有重要意义的研究方向[8].针对LDRs与SDRs序列特点,构建不同尺度的基预测模型,为了保证这些基模型集成后能够获得更全面的信息涵盖量,采用双错测度法进行基模型间差异度的度量,挑选出具有较大差异度的基模型进行集成,建立IDPs集成预测模型.通过一个系数,将集成预测模型的输出结果与窗口中心三肽氨基酸形成不规则结构的统计概率(disorder probability of central trimer,DPCT)相结合,作为最终的预测结果.
1 数据和方法
1.1 数据
本文实验所需数据分为2部分,规则蛋白质(ordered proteins,OPs)和 IDPs.
OPs来自于PDB数据库.为了保证数据的质量,需要对数据进行挑选.本文中OPs的实验获取方法为X射线衍射,其清晰度好于2.0˚A;为了去除数据的冗余性,序列间的相似性小于30%.经过处理后,共挑选出829个OPs.
IDPs来自于Disprot数据库于2011年公布的5.7版.由于目前Disprot数据库包含的IDPs数目比较少,因此本文选用了5.7版中包含……
