基于生成式对抗网络的开放式信息抽取
2021-02-25韩家宝王宏志
智能计算机与应用 2021年10期
韩家宝, 王宏志
(哈尔滨工业大学 计算机科学与技术学院, 哈尔滨 150001)
0 引 言
信息抽取是自然语言处理领域内的重要研究内容之一。 研究目的是将文本结构化,结构化后的内容可以是三元组的表示形式,也可以是多元关系的表示形式[1]。 传统的信息抽取方法侧重于在语料库上建立一套预定义的抽取范式[2-4]。 因此,这些方法离不开大量的人工参与,为了减少信息抽取中的人工参与,研究人员提出了开放式信息抽取[5-6],开放式信息抽取不局限于一组与定义的目标关系,而是提取文本中发现的所有类型关系。 近年来,开放式信息抽取取得了可观的研究成果[4,7-20],一系列的开放式信息抽取系统陆续被应用到各种工具当中。 这些系统普遍采用多种自然语言处理工具,因此也无一例外地面临着错误积累和传播的问题[21]。近期的工作多采用端到端的神经网络方法来进行开放式信息抽取的研究,这些方法虽然有效避免了错误积累和传播问题,但却没有考虑到曝光偏差问题,即:使用编码器-解码器架构处理序列到序列问题时,训练阶段与测试阶段所使用的数据不一致。
本文中,提出了基于生成式对抗网络(GAN)[6,22]的模型来应对开放式信息抽取任务,GAN 模型不仅避免了传统方法带来的错误累积和传播问题,还能很好地解决曝光偏差问题[5,23-25]。 此模型包含一个序列生成器,一个鉴别器。 其中,序列生成器负责生成开放式信息抽取的结果,鉴别器用于鉴定生成器的结果是否来自训练数据。……
登录APP查看全文
