面向冗余度控制的中文多文档自动文摘
2012-06-29王红玲周国栋朱巧明
中文信息学报 2012年2期
王红玲,周国栋,朱巧明
(苏州大学 计算机科学与技术学院,江苏 苏州 215006)
1 引言
多文档自动文摘是指从一组文档集合中提取出重要信息组成代表该文档集合的摘要,该文档摘要可以帮助人们快速、高效地获取信息。通常多文档自动文摘可分成三步: 文本分析,文本内容选择和文摘生成。和单文档自动文摘相比,多文档自动文摘需要考虑文档之间的相关性,以及文档信息之间的冗余性。因此如何控制信息冗余和如何选择文摘句来代表文档内容是多文档自动文摘的关键所在。本文在充分考虑文摘特性的基础上,提出了一个冗余度控制模型,该模型主要在文摘生成阶段通过综合考虑文本单元之间的相似度来选择句子作为文摘。在相似度计算上,本文通过计算文本单元的主题概率分布之间的相似性来获得。
文章第二部分简述了中文多文档自动文摘的相关研究;第三部分介绍了基于冗余度控制模型;第四部分总体介绍了面向冗余控制的中文多文档自动文摘系统;第五部分对实验结果进行了分析和比较;最后第六部分对本文进行了总结,并对后期工作进行了展望。
2 相关工作
中文多文档自动文摘相比于英文而言起步较晚,从技术上看,采用的主要技术手段大致相同。同时在这些技术使用过程中,需要利用的一些中文的资源和测试平台还不够成熟,例如,中文多文档文摘缺乏统一的标注语料和评测方法,一些中文信息处理技术还不够成熟,在某种程度上制约了中文多文档自动文摘的发展。……
登录APP查看全文
