APP下载

一种自动构建数据集的实体关系抽取方法*

2021-08-30房冬丽陈正雄黄元稳衡宇峰

通信技术 2021年8期
关键词:文本模型

房冬丽,陈正雄,黄元稳,衡宇峰

(中国电子科技集团公司第三十研究所,四川 成都 610000)

0 引言

实体和关系概括了文本主要内容,能够直观地展现数据之间的联系,为智能问答、检索系统等下游任务提供基础数据。目前,除了论文等形式规范的文献提供了几个关键词外,大部分文献资料都没有提供能够反映其内容的、直观的数据结构。依靠人工阅读文本来抽取文档实体关系的传统方法在拥有多源、海量文档数据的今天越来越不能满足实际应用的需求。因此,如何高效、准确地抽取实体和关系是当前急需解决的一个问题。目前,抽取实体、关系的方法层出不穷,总结起来主要分为基于规则的方法和机器学习的方法两大类。

(1)基于规则[1]的方法。该方法需要构建一定数量的规则模板集合,由领域的相关语言学家建模、指定匹配模式。它在字符、单词特征分析、词法分析以及句法依存分析等语言学知识的基础上,获取高质量的语法模式匹配模板,挖掘文本中现存的关系模式。这种手工编制规则的方法在早期能有效地应用到专业领域,但由于语言规则的复杂多样性,需要消耗大量的人力来编写规则。

(2)机器学习[2-9]的方法。该方法中的实体关系抽取方法大多是从语言特征来考虑。需要考虑如何提取词性标注、语法解析树等特征,并且需要预先构建一定的样本数据,再将样本输入到模型训练。然而,构建特征依赖于自然语言处理工具的技术水平,工具产生的误差会在实体关系抽取过程中传播和积累,对后续操作影响较大。……

登录APP查看全文

猜你喜欢

文本模型
一半模型
初中群文阅读的文本选择及组织
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化
FLUKA几何模型到CAD几何模型转换方法初步研究
如何快速走进文本