APP下载

基于TextRank的关键词提取改进方法研究*

2021-01-19孟彩霞李楠楠

计算机与数字工程 2020年12期
关键词:文本实验

孟彩霞 张 琰 李楠楠

(西安邮电大学计算机学院 西安 710121)

1 引言

关键词是表达文档核心的最小单位。从单个或多个文档中的文本中提取关键短语是信息检索(IR),文本挖掘(TM)和自然语言处理(NLP)领域中的重要问题,也是文档聚类,文档摘要和信息检索任务的基本步骤。因此,关键字提取在文本数据挖掘领域发挥着重要作用。

关键字提取包含有监督的提取方法和无监督的提取方法[1]。鉴于有监督的关键词提取方法需要人工标记的语料库,而人工标记因人而异,从不同的角度出发有不同的结果。本文主要关心无监督的关键词提取方法,表1为典型的无监督关键词提取方法对比。

基于图形的文本表示被称为提取关键短语的最佳无监督方法之一,可以非常有效地查询文本和结构信息之间的联系。其中,最具有代表性的就是谷歌提出的PageRank算法[7]。TextRank将PageRank算法思想引入文本,以词语为图节点,文本间的共现关系表示为图结构,并通过图的迭代计算实现重要性排序,可以用于关键词/文本摘要抽取[6]。经典的Text Rank算法在摘要提取时只考虑了句子节点间的相似性,而忽略了文档的篇章结构及句子的上下文信息。文献[8]中,于珊珊等提出引入标题、段落信息、句子长度等外部信息,改善TextRank中句子相似度计算方法和权重调整因子。文献[9]中,利用Word2vec模型训练词向量计算词汇之间的相似度,进而对TextRank算法进行改进。文献[10~12]中,利用LDA算法对文本语料库进行挖掘,进而改善TextRank算法。文献[13]中,利用聚类算法调整簇内节点的投票重要性,结合节点的覆盖和位置因素,改进TextRank算法以提高关键词的提取效果。……

登录APP查看全文

猜你喜欢

文本实验
记一次有趣的实验
初中群文阅读的文本选择及组织
在808DA上文本显示的改善
做个怪怪长实验
基于doc2vec和TF-IDF的相似文本识别
NO与NO2相互转化实验的改进
实践十号上的19项实验
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化
如何快速走进文本