基于FrameNet框架关系的文本蕴含识别
2012-06-29李国臣刘海静石向荣CollinBaker
张 鹏,李国臣,李 茹 2,刘海静,石向荣,Collin Baker
(1. 山西大学 计算机与信息技术学院,山西 太原 030006;2. 山西大学 计算智能与中文信息处理教育部重点实验室,山西 太原 030006;3. 中北大学 电子与计算机科学技术学院,山西 太原 030051;4. International Computer Science Institute, 1947 Center St. Suite 600 Berkeley, California, 94704)
1 引言
为了有效地处理自然语言中广泛存在的同义异形现象,近年来国外一些学者尝试使用文本蕴含(Text Entailment)[1]来为语言中纷繁复杂的同义表达建立模型。文本蕴含可以定义为: 一个连贯的文本(Text)T和一个被看作假设(Hypothesis)H之间的一种语义包含关系。如果H的意义可以从文本T的意义中推断出来,那么就说T蕴含H(即H是T的推断)。文本蕴含的研究对于自然语言处理中不同应用所需的语言表达多样性的推理识别有着重要意义。例如,在多文本自动文摘中,从文本中省去的冗余句子或表达应该被摘要中的其他表达所蕴含;对于信息抽取,表达相同关系的不同文本之间也存在着蕴含关系。
文本蕴含识别(Recognizing Textual Entailment, RTE)是美国国家标准技术研究所(National Institute of Standards and Technology, NIST)举办的文本分析会议(Text Analysis Conference, TAC)中的一项评测,该评测已经举行了6年,构造了一定的文本蕴含推理模型和识别模型。Peter Clark 和Phil Harrison[2]使用WordNet和DIRT推理规则库开发了一个基于推理的文本蕴含识别系统BLUE。Debarghya Majumdar和Pushpak Bhattacharyya[3]通过分析文本T和假设H之间的词汇重叠来发现它们之间的蕴含关系。Alexander Volokh、Giinter Neumann和Bogdan Sacaleanu[4]提出了一种联合确定性依存句法分析和线性分类的鲁棒性文本蕴含识别方法。2009年有21所科研院所参加RTE-5评测任务,其任务分为两类: 3-ways和2-ways。在3-ways任务中最高准确率为68.33%,平均准确率为52.91%,在2-ways任务中最高准确率达到73.5%,平均准确率为61.52%。……
