服务于内容侧面发现的框架识别
2012-06-29李素建姜伯平
中文信息学报 2012年2期
王 荀,李素建,宋 涛,姜伯平
(北京大学 计算语言学教育部重点实验室,北京 100871)
1 引言
在现阶段自然语言处理研究中,统计学方法应用比较广泛。但是单纯基于统计[1-2],而不对文本信息进行理解不能保证信息覆盖的全面性。此处以及下文,我们以自动摘要为例,说明理解文本信息的重要性。自动摘要是自然语言处理的一个重要任务,它试图将长文档压缩为不损失重要信息的短文档。常用的方法可以有抽取式和生成式两种,其中抽取式方法应用比较广泛,它主要是从文中抽取句子构成摘要。
抽取式方法多以词频为主要特征[3],倾向关注出现频次较高的信息。但是人们关注的侧面不同,重要信息并不完全等同于出现频次较高的信息。常常有某些信息虽然重要,却由于频次的关系而不能被选入摘要。特别是在多文档新闻摘要中,新闻报道同质化比较严重,一部分信息的冗余度较高,而另一部分人们关注的信息又由于出现频次不够而被舍弃。在我们参加的TAC 2010[4]的自动摘要任务中,就提出要求,好的摘要须尽可能全面地报道整个事件,要涵盖不同内容侧面(aspect)的信息。
解决问题的一个方法是减少冗余,这样可以增加信息量,从而尽可能地提高信息覆盖的全面性。其中MMR[5]是一种常用的策略,但MMR也主要是从词语层的相似度出发,并没有进行语义的分析,因而不能彻底解决这个问题。一个较好的办法是对文本进行语义分析,然后根据文本所描述的信息进行取舍。……
登录APP查看全文
