APP下载

服务于内容侧面发现的框架识别

2012-06-29李素建姜伯平

中文信息学报 2012年2期
关键词:语义特征文本

王 荀,李素建,宋 涛,姜伯平

(北京大学 计算语言学教育部重点实验室,北京 100871)

1 引言

在现阶段自然语言处理研究中,统计学方法应用比较广泛。但是单纯基于统计[1-2],而不对文本信息进行理解不能保证信息覆盖的全面性。此处以及下文,我们以自动摘要为例,说明理解文本信息的重要性。自动摘要是自然语言处理的一个重要任务,它试图将长文档压缩为不损失重要信息的短文档。常用的方法可以有抽取式和生成式两种,其中抽取式方法应用比较广泛,它主要是从文中抽取句子构成摘要。

抽取式方法多以词频为主要特征[3],倾向关注出现频次较高的信息。但是人们关注的侧面不同,重要信息并不完全等同于出现频次较高的信息。常常有某些信息虽然重要,却由于频次的关系而不能被选入摘要。特别是在多文档新闻摘要中,新闻报道同质化比较严重,一部分信息的冗余度较高,而另一部分人们关注的信息又由于出现频次不够而被舍弃。在我们参加的TAC 2010[4]的自动摘要任务中,就提出要求,好的摘要须尽可能全面地报道整个事件,要涵盖不同内容侧面(aspect)的信息。

解决问题的一个方法是减少冗余,这样可以增加信息量,从而尽可能地提高信息覆盖的全面性。其中MMR[5]是一种常用的策略,但MMR也主要是从词语层的相似度出发,并没有进行语义的分析,因而不能彻底解决这个问题。一个较好的办法是对文本进行语义分析,然后根据文本所描述的信息进行取舍。……

登录APP查看全文

猜你喜欢

语义特征文本
语言与语义
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
“上”与“下”语义的不对称性及其认知阐释
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
认知范畴模糊与语义模糊
如何快速走进文本
线性代数的应用特征