融合词义信息的文本蕴涵识别方法
2021-08-13杜倩龙宗成庆苏克毅
中文信息学报 2021年7期
杜倩龙,宗成庆,苏克毅
(1.中国科学院自动化研究所模式识别国家重点实验室,北京100190;2.中国科学院大学人工智能学院,北京100049;3.台湾“中央研究院”资讯科学研究所,台湾台北11529)
0 引言
文本蕴涵识别(recognizing textual entailment,RTE)旨在利用各种分析手段有效理解文本的语义,然后推理出文本之间的语义蕴涵关系。如表1所示,该任务通常给定一个前提文本P(premise)和一个假设文本H(hypothesis),然后判定是否可以从前提文本P的语义中推理出假设文本H 的含义,从而推断出文本P 和文本H 之间的关系是蕴涵(entailment)、中立(neutral)还是矛盾(contradiction)。文本蕴涵识别有效解决了语言表达的多样性和歧义性问题,被广泛应用于自动问答[1]和文本摘要[2]等自然语言处理任务中。为了有效评估文本蕴涵识别系统的性能,在过去的十几年间学界组织了大量的文本蕴涵识别相关评测,例如,RTE[3]和Sem Eval-2014[4]等。早期的文本蕴涵识别相关研究都是在小规模的数据集之上,基于人工定义的规则和特征,利用传统的统计学方法、规则方法和逻辑推理方法等进行的文本间蕴涵关系的判定[5-6]。

表1 文本蕴涵识别样例
随着深度神经网络方法的快速发展和大规模文本蕴涵识别数据集SNLI[7]和MultiNLI[8]的出现,基于神经网络的文本蕴涵识别方法[7-17]开始大量涌现并取得了很好的效果。神经网络文本蕴涵识别方法主要采用神经网络结构对两个输入文本进行编码,从而生成文本的向量表示,然后对这两个输入文本的向量表示进行比较,最终判定文本之间的语义蕴涵关系。……
登录APP查看全文
