APP下载

基于FrameNet框架关系的文本蕴含识别

2012-06-29李国臣刘海静石向荣CollinBaker

中文信息学报 2012年2期
关键词:语义词汇文本

张 鹏,李国臣,李 茹 2,刘海静,石向荣,Collin Baker

(1. 山西大学 计算机与信息技术学院,山西 太原 030006;2. 山西大学 计算智能与中文信息处理教育部重点实验室,山西 太原 030006;3. 中北大学 电子与计算机科学技术学院,山西 太原 030051;4. International Computer Science Institute, 1947 Center St. Suite 600 Berkeley, California, 94704)

1 引言

为了有效地处理自然语言中广泛存在的同义异形现象,近年来国外一些学者尝试使用文本蕴含(Text Entailment)[1]来为语言中纷繁复杂的同义表达建立模型。文本蕴含可以定义为: 一个连贯的文本(Text)T和一个被看作假设(Hypothesis)H之间的一种语义包含关系。如果H的意义可以从文本T的意义中推断出来,那么就说T蕴含H(即H是T的推断)。文本蕴含的研究对于自然语言处理中不同应用所需的语言表达多样性的推理识别有着重要意义。例如,在多文本自动文摘中,从文本中省去的冗余句子或表达应该被摘要中的其他表达所蕴含;对于信息抽取,表达相同关系的不同文本之间也存在着蕴含关系。

文本蕴含识别(Recognizing Textual Entailment, RTE)是美国国家标准技术研究所(National Institute of Standards and Technology, NIST)举办的文本分析会议(Text Analysis Conference, TAC)中的一项评测,该评测已经举行了6年,构造了一定的文本蕴含推理模型和识别模型。Peter Clark 和Phil Harrison[2]使用WordNet和DIRT推理规则库开发了一个基于推理的文本蕴含识别系统BLUE。Debarghya Majumdar和Pushpak Bhattacharyya[3]通过分析文本T和假设H之间的词汇重叠来发现它们之间的蕴含关系。Alexander Volokh、Giinter Neumann和Bogdan Sacaleanu[4]提出了一种联合确定性依存句法分析和线性分类的鲁棒性文本蕴含识别方法。2009年有21所科研院所参加RTE-5评测任务,其任务分为两类: 3-ways和2-ways。在3-ways任务中最高准确率为68.33%,平均准确率为52.91%,在2-ways任务中最高准确率达到73.5%,平均准确率为61.52%。……

登录APP查看全文

猜你喜欢

语义词汇文本
本刊可直接用缩写的常用词汇
一些常用词汇可直接用缩写
语言与语义
在808DA上文本显示的改善
本刊可直接用缩写的常用词汇
基于doc2vec和TF-IDF的相似文本识别
“上”与“下”语义的不对称性及其认知阐释
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
认知范畴模糊与语义模糊
如何快速走进文本