蛋白质中RNA-结合残基预测的随机森林模型
2012-08-15马昕郭静孙啸
东南大学学报(自然科学版) 2012年1期
马 昕 郭 静 孙 啸
(1东南大学生物电子学国家重点实验室,南京 210096)(2南京审计学院金审学院,南京 210029)
蛋白质与RNA的相互作用在生物体细胞活动中起到至关重要的作用,如蛋白质的合成、信使RNA的稳定、定位和转录、病毒的复制、非编码RNA发挥生物学作用等.而今国际上对蛋白和RNA相互作用的研究主要关注于蛋白质能否与RNA相互作用、如何相互作用以及在蛋白质链上哪些残基与 RNA分子进行结合等.提高识别RNA-结合残基的能力不仅有助于更好地理解上述生物学过程,还可更好地指导用于研究核酸结合蛋白功能点的突变实验研究,能够进一步地指导药物开发.
目前已有较多利用复合物的三维结构信息来识别RNA-结合残基的算法,但是可得到的高分辨率结构的蛋白质-RNA复合物的结构数据很少;而且,通过实验的方法获得复合物结构不仅价格昂贵而且耗时.一种可替代的方法就是直接从蛋白质序列出发来预测RNA-结合残基,而机器学习方法通过构建分类器提供了一条行之有效的途径来解决这个问题.例如人工神经网络利用氨基酸序列信息和结构信息作为特征预测RNA-结合残基[1].支持向量机也广泛应用于识别RNA-结合残基并取得了很好的预测效果,如RISP[2]达到了61.0%的敏感性和83.3%的特异性.此外,代表进化保守信息的位置特异性矩阵(PSSM)是一种重要的特征,利用这个特征能有效地预测RNA-结合残基.Kumar等构建了利用支持向量机和PSSM 的模型[3],预测得到的MCC值、准确率、特……
登录APP查看全文