APP下载

中文嵌套命名实体关系抽取研究

2019-01-29许浩亮李雁群何云琪钱龙华

北京大学学报(自然科学版) 2019年1期
关键词:语义特征模型

许浩亮 李雁群 何云琪 钱龙华

苏州大学计算机科学与技术学院, 苏州 215006; † 通信作者, E-mail: qianlonghua@suda.edu.cn

信息抽取的目的是从无结构的自由文本中抽取实体及其相互关系, 并转化为结构化表达形式, 从而为知识库的构造提供数据基础[1-2]。命名实体间语义关系抽取(简称关系抽取)指从文本中提取实体间的语义关系。关系抽取研究对自然语言处理(如问答系统、文档摘要、知识库、本体库等)具有重要的意义。

近十几年来, 得益于基准语料库(如 ACE[3],SemEval[4])的出现, 关系抽取的研究取得长足的进步。无论是传统的机器学习方法[5-6], 还是近年来流行的深度学习方法[7-10], 关系抽取研究都成为机器学习算法的试金石。但是, 目前语料库中定义的实体大部分是单一层次的简单实体(如 ACE), 抽取的关系也限于简单实体之间。虽然有一些生物医学领域的嵌套实体语料库[11], 但是没有定义这些嵌套实体内部的语义关系。另一方面, 由于嵌套实体含丰富的实体信息及实体间相互关系, 提取这些嵌套实体之间的语义关系有助于丰富知识库的内容。

针对上述情况, 本文在《人民日报》中文实体语料库的基础上, 通过自动生成和手工标注, 构建一个中文嵌套实体语料库, 并进一步标注嵌套实体内部的语义关系, 然后在该语料上分别使用传统的机器学习方法和深度学习方法, 进行嵌套实体关系抽取实验。

1 相关工作

目前, 关系抽取研究中常用的语料库有 ACE 语料库和 SemEval 2010 语料库。ACE 2005 语料库标注了实体……

登录APP查看全文

猜你喜欢

语义特征模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
语言与语义
如何表达“特征”
不忠诚的四个特征
3D打印中的模型分割与打包
“上”与“下”语义的不对称性及其认知阐释
认知范畴模糊与语义模糊
线性代数的应用特征
语义分析与汉俄副名组合