基于关键词的蛋白质交互关系识别
2019-03-21毛宇薇
计算机技术与发展 2019年3期
关键词:词汇
毛宇薇,牛 耘
(南京航空航天大学 计算机科学与技术学院,江苏 南京 211106)
0 引 言
蛋白质是生物细胞的重要组成成分,细胞中多数重要的分子过程均通过蛋白质交互作用完成。蛋白质交互关系(protein-protein interaction,PPI)的识别对于生命过程的研究、疾病的治疗以及新药的研制具有十分重要的意义,是解决大量医学难题的关键信息。随着近年来互联网的迅速发展,生物医学文献数量飞速增长,以人工识别的方式从文献中获取蛋白质交互关系已经难以满足实际应用的需求。因此,利用信息抽取技术自动识别PPI已经成为一项重要的研究内容。
目前用于PPI识别的技术主要分为以下几种:基于共现的方法[1]、基于模式匹配的方法[2]、基于自然语言处理的方法[3-4]和基于机器学习的方法[5-6]。基于共现的方法通过统计蛋白质对在句子中出现的概率来识别蛋白质之间是否存在交互关系,这种方法召回率较高,但缺点在于无法识别出词典外的PPI。基于模式匹配的方法通过事先建立的模式集合在文本中进行匹配来识别PPI,可以获得较高的精确度,但是人工构造模式集合需要耗费大量的人力物力。基于机器学习的方法通过将PPI识别转化为文本分类问题,同时结合自然语言处理技术,可以很好地利用已有的大量文本数据,是目前PPI识别的主要研究方法[7-8]。这种方法首先通过自然语言处理技术对文本进行处理并抽取句子中的语言学特征对蛋白质交互关系进行表示,然后利用机器学习方法从大规模文本数据中学习并建立模型来对未知蛋白质交互关系进行识别。……
登录APP查看全文
