一种新型高效的文库知识图谱实体关系抽取算法
2021-02-21胡代旺焦一源李雁妮
西安电子科技大学学报 2021年6期
胡代旺,焦一源,李雁妮
(西安电子科技大学 计算机科学与技术学院,陕西 西安 710071)
实体关系抽取旨在检测/抽取给定语句中两个实体间的语义关系。从非结构化的文本中进行实体关系的抽取以自动构建知识图谱,是信息抽取的一个重要任务,也是自然语言处理中很多下游应用的重要基础组件,例如智能问答和知识库构建等。

随着深度学习迅猛发展,近年来已产生了一些较好的深度实体关系抽取算法。ZENG等[1]采用卷积神经网络通过捕获每个单词周围的文本信息进行实体关系抽取,但是这种方法受限于卷积核的大小,难以获取远距离文本的信息。XU等与ZHOU等[2-3]借助长短记忆网络(LSTM)来获取句子语义信息,以实现实体关系的抽取。该算法在一定程度上缓解了卷积神经网络的缺陷,但是仍然难以获取长句子的全局文本语义信息。近些年,预训练语言模型在自然语言处理的各个领域都取得了非凡的表现,例如:机器翻译、语音处理、实体关系抽取等。DEVLIN等[4]提出的预训练语言模型BERT在许多自然语言处理的任务中取得了不错的结果。WU等[5]提出一种基于BERT新的实体关系抽取方法。该算法首先通过在语句中两个实体前后插入不同的标志来标注实体的位置,然后使用BERT计算句子中两个实体的上下文重表示,并使用两个实体上下文重表示的拼接作为关系的隐状态输入到分类层。SOARES等[6]同样采用BERT模型,在此基础上测试了多种实体标注方式与输出方式,进一步提出了一种使用大量无标签数据训练模型的方式。……
登录APP查看全文
