基于机器阅读理解模型与众包验证的属性值抽取方法
2021-05-17刘井平蒋海云肖仰华
计算机工程 2021年5期
冯 桫,刘井平,蒋海云,肖仰华
(复旦大学 计算机科学技术学院,上海 200433)
0 概述
近年来,随着自然语言处理需求的不断增长,知识图谱成为人们研究的焦点。目前,知识图谱已经被广泛地应用于各种智能化的推荐系统[1]、问答系统[2]以及语言生成[3]等诸多场景。为满足这些应用的数据需求,研究人员构建出大规模的知识图谱,如英文的DBpedia[4]、YAGO[5]以及中文的CN-DBpedia[6]等。在这些知识图谱中,数据通常以<实体,属性(关系),属性值(尾实体)>的三元组形式进行组织,例如“特朗普的国籍是美国”这一条知识,就可以被表示为<特朗普,国籍,美国>。由于本文所叙述的方法对属性值及尾实体的抽取均适用,后文将属性和关系统一称为属性,将属性值和尾实体统一称为属性值。
在构建知识图谱的过程中,获取图谱中实体相关的各属性的属性值是非常重要的步骤。传统的属性值抽取方法主要分为基于模式的方法、基于分类器的方法和基于序列标注模型的方法。基于模式的方法通常被用于从高质量的半结构化文本(如百科页面的信息表)中,利用句法模式[7]、语义模式[8]或正则表达式等人工或自动生成的模式直接进行抽取。由于这类半结构化文本的表达规律性强,通过基于模式的方法可以用较小代价得到大量高质量的三元组。此类方法已经被应用于大量的知识图谱构建实践中。基于分类器的方法首先需要利用命名实体识别(NER)工具,在文本中定位整个三元组的实体和属性值。……
登录APP查看全文
