APP下载

基于关联记忆网络的中文细粒度命名实体识别∗

2021-11-09琚生根李天宁孙界平

软件学报 2021年8期
关键词:记忆模型

琚生根,李天宁,孙界平

(四川大学 计算机学院,四川 成都 610065)

命名实体识别是自然语言处理中的信息抽取任务之一,其目的是对文本中特定类别的实体进行定位和分类.大多数命名实体识别任务只识别人名、组织、地点等实体类别,识别的实体类别少,并且类别划分的比较宽泛.然而,细粒度命名实体识别更符合现实世界的知识体系,在一些常见类别的基础上做了近一步的类别划分,需要识别的实体种类远多于一般的命名实体识别.这样,从文本中抽取的实体就拥有了一个更详细的定义,为下游的知识图谱的构建和问答任务提供更有力的支撑.

在细粒度命名实体识别中,更细粒度的划分会造成各实体类别在语义上有更紧密的距离.模型对语义相近类别的实体进行分类时容易发生混淆,这意味着细粒度实体类别的区分更具有挑战性.目前,中文公开的高质量细粒度命名实体识别的数据集很少,CLUENER2020[1]数据集包含10 种不同的实体类别,并对一些常见类别进行了细粒度的划分,如从“地点”中分离出来了“景点”,从“组织”中分离出了“政府”和“公司”,这就造成“地点”和“景点”之间,“组织”“政府”和“公司”之间的混淆程度较高.同时,存在同一实体在不同语境下属于不同类别的情况,如“游戏”可以是一些“书籍”和“电影”的改编.如表1 所示,实体“《黑暗之塔》”在第1 个句子中属于“游戏”类别,在第2 和第3 个句子中属于“书籍”.在这种情况下,对实体类别的区分需要结……

登录APP查看全文

猜你喜欢

记忆模型
一半模型
夏天的记忆
重尾非线性自回归模型自加权M-估计的渐近分布
记忆中的他们
3D打印中的模型分割与打包
端午记忆
儿时的记忆(四)
儿时的记忆(四)
记忆翻新
FLUKA几何模型到CAD几何模型转换方法初步研究