基于TextRank的关键词提取改进方法研究*
2021-01-19孟彩霞李楠楠
计算机与数字工程 2020年12期
孟彩霞 张 琰 李楠楠
(西安邮电大学计算机学院 西安 710121)
1 引言
关键词是表达文档核心的最小单位。从单个或多个文档中的文本中提取关键短语是信息检索(IR),文本挖掘(TM)和自然语言处理(NLP)领域中的重要问题,也是文档聚类,文档摘要和信息检索任务的基本步骤。因此,关键字提取在文本数据挖掘领域发挥着重要作用。
关键字提取包含有监督的提取方法和无监督的提取方法[1]。鉴于有监督的关键词提取方法需要人工标记的语料库,而人工标记因人而异,从不同的角度出发有不同的结果。本文主要关心无监督的关键词提取方法,表1为典型的无监督关键词提取方法对比。
基于图形的文本表示被称为提取关键短语的最佳无监督方法之一,可以非常有效地查询文本和结构信息之间的联系。其中,最具有代表性的就是谷歌提出的PageRank算法[7]。TextRank将PageRank算法思想引入文本,以词语为图节点,文本间的共现关系表示为图结构,并通过图的迭代计算实现重要性排序,可以用于关键词/文本摘要抽取[6]。经典的Text Rank算法在摘要提取时只考虑了句子节点间的相似性,而忽略了文档的篇章结构及句子的上下文信息。文献[8]中,于珊珊等提出引入标题、段落信息、句子长度等外部信息,改善TextRank中句子相似度计算方法和权重调整因子。文献[9]中,利用Word2vec模型训练词向量计算词汇之间的相似度,进而对TextRank算法进行改进。文献[10~12]中,利用LDA算法对文本语料库进行挖掘,进而改善TextRank算法。文献[13]中,利用聚类算法调整簇内节点的投票重要性,结合节点的覆盖和位置因素,改进TextRank算法以提高关键词的提取效果。……
登录APP查看全文
