基于优势演员-评论家算法的强化自动摘要模型
2021-03-18
(华东理工大学信息科学与工程学院,上海 200237)
0 引言
互联网上的信息量正以指数级的速度增长,如何从海量的文本信息中准确、快速地获取有用信息,是当今人们最迫切的需求[1]。文本自动摘要技术对给定源文本信息进行概括与总结,并产生简洁、流畅且保留关键信息的短文本,这不仅可以缓解搜索引擎检索导致的冗余问题,而且可以有效解决信息过载的缺陷[2]。
文本自动摘要可分为抽取式方法(Extractive)和生成式方法(Abstractive)。抽取式方法抽取源文本关键句组成摘要,如TextRank 算法[3]将句子作为节点,用相邻边的权重大小表示节点的语义相似度,选取得分最高的k个节点作为摘要。生成式方法是近年来流行的方法,在理解原文的基础上,逐词生成摘要,可得到语义更精确的摘要,通常可用机器学习或深度学习实现,如基于注意力机制的序列到序列(sequence to sequence,seq2seq)模型[4]、利用卷积神经网络(Convolutional Neural Network,CNN)对源文本编解码,并引入注意力机制,在DUC数据集上取得了不错的效果。
目前,研究者们深入研究了自动文本摘要领域,提出了许多新颖的模型。Sharma 等[5]提出实体驱动的生成式摘要模型(System for ENtity-drivEn Coherent Abstractive summarization model,SENECA),利用实体信息产生包含有用信息的连贯摘要。Zhang 等[6]提出通过抽取空缺句的预训练生成式摘要模型(Pre-training with Extracted GAp-Sentences for abstractive Summarization model,PEGASUS),利用新的预训练目标(Gap Sentences Generation,GSG)用于摘要总结、空缺句子生成,在所有12 个下游数据集上都达到了最先进的性能。Saito 等[7]提出具有重要标记的条件摘要模型(Conditional summarization model with Important Tokens,CIT),该模型将显著性模型提取的标记序列显式地提供给seq2seq 模型作为附加输入文本。……
