基于深度学习的中文生物医学实体关系抽取系统
2021-06-10丁泽源杨志豪林鸿飞
中文信息学报 2021年5期
丁泽源,杨志豪,罗 凌,王 磊,张 音,林鸿飞,王 健
(1. 大连理工大学 计算机科学与技术学院,辽宁 大连 116024;2. 军事医学科学院,北京 100850)
0 引言
伴随着生物医学领域的飞速发展,生物医学领域的相关文献数量也呈现指数级别增长。由于文献中蕴含着海量的生物医学知识,人工提取文献信息需要耗费大量的时间,而且很难满足相关的研究人员的研究需求。因此,如何自动地从生物医学文献中抽取结构化信息成为一个重要的研究领域。
在当前自然语言处理(natural language processing,NLP)研究中,文本挖掘技术的兴起给上述难题提供了相应的解决方案。文本挖掘技术是指从非结构化的文本数据中自动发现和抽取有价值知识的过程,而命名实体识别和关系抽取任务是文本挖掘技术中关键的步骤。对于给定的一段文本,实体识别和关系抽取技术需要在辨别实体的基础上,抽取出实体之间的关系。如今实体识别和关系抽取越来越多地被应用于专业领域,如医疗、教育、生物等领域。由于生物医学与人类的健康密切相关,因此该领域的信息抽取技术也受到学界的广泛关注。然而生物医学领域中有大量的专业名词的缩写,并且名词与名词之间也存在着不同种类的关系,这给生物医学领域的信息抽取任务带来了挑战。基于此,本文构建了一个基于深度学习的中文生物医学实体关系抽取系统,该系统可以自动地识别中文生物医学文献中的实体以及实体间关系。
生……
登录APP查看全文
