基于改进TextRank的文本摘要自动提取
2021-06-21汪旭祥
汪旭祥 韩 斌 高 瑞 陈 鹏
(江苏科技大学计算机学院 江苏 镇江 212003)
0 引 言
自动文本摘要属于自然语言处理(Natural Language Processing,NLP)任务之一,旨在对文本进行处理从而生成简洁、精炼的内容,即概要信息。自动文本摘要一般可以分为生成式(abstractive)摘要和抽取式(extractive)摘要[1]两大类,前者是在理解整篇文章语义的基础上,提取概括性信息;后者是从原文中找到与中心思想相近的一些句子作为摘要,属于在句子的级别上生成摘要[2],从方法上可以划分为基于统计信息方法、基于主题模型方法、基于图模型方法和基于机器学习方法等。其中,基于图模型方法的图排序算法因其充分考虑文本图的全局信息且不需要人工标注训练集的特性,被广泛应用于自动文本摘要领域[3-4]。TextRank算法作为一种经典的文本图排序算法,它利用文本本身的信息和结构特征来实现文本摘要的自动提取[5]。2004年,Mihalcea等[6]在研究自动摘要提取过程中,借鉴Google公司的PageRank算法的思路,提出了TextRank算法,将句子间的相似关系看成是一种推荐或投票关系,由此构建TextRank网络图[7-8],并通过迭代计算至收敛来得到句子的权重值。自TextRank算法被提出以来,基于该算法的自动文本摘要的研究受到广泛的关注。刘志明等[9]从情感特征出发,通过LDA模型收敛主题,融合传统多特征和情感相似度来提取目的摘要,但未考虑句子的上下文信息。文献[10]将句法、语义和统计方法共同作用于句子的评分,提出了TextRankExt算法。文献[11]分别比较了不同相似度计算方法的自动文摘效果,选择了其中最优的相似度计算方法,并结合句子位置、线索词与经典TextRank来计算句子的权重。……
