APP下载

基于交叉预测的蛋白质交互识别

2018-04-13闵庆凯蔡松成

计算机技术与发展 2018年4期
关键词:监督方法

闵庆凯,蔡松成

(南京航空航天大学 计算机科学与技术学院,江苏 南京 211106)

1 概 述

蛋白质是生物细胞最重要的组成成分,通过交互作用执行着细胞内多数重要的分子过程。蛋白质交互作用(protein-protein interaction,PPI)的研究以及蛋白质交互网络的建立是生物信息学研究的重要内容。目前,已有的交互关系数据库,例如HPRD[1]、BIND[2]、DIP[3]、InAct[4]和MINT[5],均由生物医学专家通过人工识别的方法从医学文献中搜集得到。然而,随着生物医学文献的急剧增加,人工抽取的方法变得越来越不切实际,因此利用计算机信息抽取技术自动地从自然语言文本中抽取PPI成为一项重要的研究内容。

目前,用于PPI抽取的技术主要包括基于词共现的方法[6]、基于规则的方法[7]和基于统计机器学习的方法[8-9]。基于词共现的方法通过统计两个蛋白质名称在句子中共同出现的概率来判断是否存在交互关系,这种方法召回率高但很难发现词典外的PPI[10];基于规则的方法利用模式匹配的思想,可以取得较高的精确率,但泛化能力差,而且通过手动建立规则的方法需要大量的人力物力[11];基于统计机器学习的方法通过将关系抽取问题转换为分类问题,同时结合自然语言处理方法,较好地解决了上述两种方法存在的问题,目前广泛用于PPI的抽取。这类方法又可分为基于特征的方法和基于核函数的方法。其中,基于特征的方法从句子中提取大量的语言学特征,包括词法、语法和语义等特征来表示关系实例[12],能够简单有效地完成关系抽取任务;……

登录APP查看全文

猜你喜欢

监督方法
突出“四个注重” 预算监督显实效
学习方法
监督见成效 旧貌换新颜
夯实监督之基
用对方法才能瘦
四大方法 教你不再“坐以待病”!
赚钱方法
捕鱼
绩效监督:从“管住”到“管好”
监督宜“补”不宜“比”