基于密集连接思想的小样本关系抽取研究
2021-08-23刘月峰段毅
现代计算机 2021年20期
刘月峰,段毅
(内蒙古科技大学信息工程学院,包头014010)
0 引言
关系抽取[1]是自然语言处理领域的热点任务之一,它是信息抽取、自动问答和知识图谱补全等领域的子任务之一。关系抽取的目标是识别出文本语句中标记实体对之间的预先定义好的语义关系。例如,“姚明的妻子是叶莉”,姚明和叶莉是文本中的标记实体,关系抽取的目标就是去识别出姚明与叶莉两个实体之间的夫妻关系。目前的关系抽取方法大致可以分为两类,它们分别是基于依存句法关系的方法和基于序列的方法。基于依存句法关系的方法是将文本序列的语义依存树提取到机器学习模型中,通过沿着语义依存树形成的计算图构建出句子的分布式表示,然后再进行分类,但是这种方法易受符号间语义鸿沟的影响。基于序列的模型对单词序列进行编码,使用卷积神经网络或循环神经网络将句子的文本序列编码为向量化的语义特征,具有更高的鲁棒性。另外,在实际环境下,由于人工数据标注的成本较为昂贵,精确而丰富的训练数据不易获得,我们在实践过程中收集到的往往是小样本量的样本数据,现有的大多数机器学习模型往往依赖大量而且精确的训练数据,并且由于样本量过少,模型容易产生过拟合问题,导致在小样本数据集上却无法获得令人满意的结果。
1 小样本关系抽取
本文提出一种基于密集连接思想的小样本关系抽取框架。时间卷积网络[2-3]如图1所示,是一种在CNN的基础上进行改进,能够有效捕捉到更多长依赖数据,减少信息损失,处理时间序列数据的网络结构。……
登录APP查看全文
