基于主体掩码的实体关系抽取方法
2021-06-09郑慎鹏陈晓军向阳沈汝超
大数据 2021年3期
郑慎鹏,陈晓军,向阳,沈汝超
1. 同济大学电子与信息工程学院,上海 201804;
2. 上海国际港务(集团)股份有限公司,上海 200080
1 引言
目前,网络上保存着海量的非结构化文本,且其规模仍呈指数级上升。同时,知识图谱被广泛应用在政府治理[1]、智能问答[2]、搜索引擎等领域,而知识图谱的内容丰富程度和及时性直接影响其应用效果。因此,作为自动化地从非结构化文本中构建知识图谱的关键技术之一,实体关系抽取技术受到了研究人员的广泛关注。实体关系抽取旨在识别出文本中实体和实体之间的语义关系,并以三元组的形式<主体,关系,客体>表示。比如,“《琴键右角》是张德兰演唱的一首单曲”中包含实体“琴键右角”和“张德兰”,且实体间存在关系“歌手”,用三元组表示为<琴键右角,歌手,张德兰>。
早期的实体关系抽取方法[3-5]和基于传统机器学习的实体关系抽取方法[6-7]需要专家构造大量的规则或者人工特征,难以应对大规模的实体关系提取。随着深度学习的兴起,神经网络模型可以自动提取文本的特征,减少人工提取特征的工作,也能更有力地应对大规模的实体关系提取工作,成为当前实体关系提取的主流方法。目前,基于神经网络的实体关系抽取方法可以分为流水线方法和联合抽取方法两类。
流水线方法将实体关系抽取分解为实体识别和关系分类两个步骤,并用两个独立的模型实现[8-10]。此类方法先用实体识别模型识别出文本中的所有实体,然后用关系分类模型判断所有可能实体对的语义关系。……
登录APP查看全文
