一种自动构建数据集的实体关系抽取方法*
2021-08-30房冬丽陈正雄黄元稳衡宇峰
通信技术 2021年8期
房冬丽,陈正雄,黄元稳,衡宇峰
(中国电子科技集团公司第三十研究所,四川 成都 610000)
0 引言
实体和关系概括了文本主要内容,能够直观地展现数据之间的联系,为智能问答、检索系统等下游任务提供基础数据。目前,除了论文等形式规范的文献提供了几个关键词外,大部分文献资料都没有提供能够反映其内容的、直观的数据结构。依靠人工阅读文本来抽取文档实体关系的传统方法在拥有多源、海量文档数据的今天越来越不能满足实际应用的需求。因此,如何高效、准确地抽取实体和关系是当前急需解决的一个问题。目前,抽取实体、关系的方法层出不穷,总结起来主要分为基于规则的方法和机器学习的方法两大类。
(1)基于规则[1]的方法。该方法需要构建一定数量的规则模板集合,由领域的相关语言学家建模、指定匹配模式。它在字符、单词特征分析、词法分析以及句法依存分析等语言学知识的基础上,获取高质量的语法模式匹配模板,挖掘文本中现存的关系模式。这种手工编制规则的方法在早期能有效地应用到专业领域,但由于语言规则的复杂多样性,需要消耗大量的人力来编写规则。
(2)机器学习[2-9]的方法。该方法中的实体关系抽取方法大多是从语言特征来考虑。需要考虑如何提取词性标注、语法解析树等特征,并且需要预先构建一定的样本数据,再将样本输入到模型训练。然而,构建特征依赖于自然语言处理工具的技术水平,工具产生的误差会在实体关系抽取过程中传播和积累,对后续操作影响较大。……
登录APP查看全文
