APP下载

文本摘要问题中的句子抽取方法研究

2012-06-29张龙凯王厚峰

中文信息学报 2012年2期
关键词:特征文本实验

张龙凯,王厚峰

(1. 北京大学 计算语言学教育部重点实验室,北京 100871)

1 概述

随着电子文本数量的剧增,快速获取文本信息的需求越来越强烈。作为浓缩文本信息的技术,自动摘要可以扮演重要的角色。自动摘要的宗旨是为用户提供简短的文本表示。在保留尽可能多的原文信息的同时,形成尽可能短的摘要。对于一个理想的抽取式摘要而言,具有三个基本特征: 源自文本、保留重要信息、长度短[1]。

按照摘要源自的文本个数,可分为单文本摘要和多文本摘要。按照摘要的方式,又分成生成式摘要和抽取式摘要。本文研究单文本、抽取式摘要问题。在抽取式摘要中,从文本中选取代表性句子是难点所在。IBM的Luhn在1958年提出一种基于高频词的方法,将高频词列出并给包含这些高频词的句子打分,得分高的句子被认为是摘要句[2]。Baxendale则引入句子位置作为判断句子重要性的一种特征,该特征被后来大部分机器学习算法所借鉴[3]。Edmundson整合了Luhn和Baxendale的方法,并在科技文献中取得了较好的应用效果[4]。Kupiee, et al.在1995年提出一种基于朴素贝叶斯算法的方法,在Edmundson的基础上增加了句长等特征[5]。同样使用朴素贝叶斯算法的还有1999年Aone, et al.,其中考虑了TF-IDF等多个特征[6]。同时期的还有1999年Lin的方法。不同于朴素贝叶斯算法的独立性假设,Lin采用决策树算法并取得了较好地效果[7]。2001年Conroy和O’leary提出一种基于隐马尔可夫模型的方法,由于隐马尔可夫模型有较强的独立性假设,该方法仍存在不足[8]。Osborne于2002年提出一种基于最大熵模型的方法,结果表明,通过增加先验概率,该方法优于基于朴素贝叶斯模型的方法。……

登录APP查看全文

猜你喜欢

特征文本实验
记一次有趣的实验
如何表达“特征”
在808DA上文本显示的改善
做个怪怪长实验
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
NO与NO2相互转化实验的改进
实践十号上的19项实验
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本