基于论文关键词和篇章结构的自动文摘抽取方法
2018-06-13孙晓腾李学明
现代计算机 2018年13期
孙晓腾,李学明
(重庆大学计算机学院,重庆 400044)
0 引言
自动文摘技术是指利用计算机算法和程序对输入文档进行分析和提取,从而产出文章摘要的过程。该文章摘要一般通顺连贯并且可以高度概括文章主旨,当前自动文摘主要应用于新闻和论文领域[1]。
本文主要面向论文领域,通过论文关键词过滤掉相关性差的句子,精炼候选句子集,并通过对论文主题和结构的分析,制定了一些影响句子重要度的规则和方法,进而影响传统TextRank算法的权重,改进文本排序结果。改进后的重要度排名更能反映出与主题的关联性,提升了自动文摘的水准。
1 自动文摘研究概述
1.1 自动文摘生成方法
在当前NLP研究领域,自动文摘根据生成原理主要分为两大类[2],一种是抽取式的(extractive),即选取原文中的一些关键句,组合形成一篇摘要;另外一种是摘要式的(abstractive),即让计算机理解原文的内容和思想,并通过合理的语法生成新的概括句,生成文章摘要。现阶段相对成熟的是基于抽取的方法,这也是目前最主流、应用最广泛的方法。
除此之外自动文摘还有一种根据输入文档数量而定的分类方式,即单文档摘要和多文档摘要[3]。本文提出的方法是基于抽取式的单文档摘要的改进算法。
1.2 自动文摘评估方法
如何高效且合理地评价一篇文摘的质量也是该领域的研究重点。自动文摘的评估方法包括人工评价和自动评价两种[4]。由于人工评价耗时长,且因为人的主观性使得评价结果因人而异,所以人工评价不完全适用于自动文摘;……
登录APP查看全文
