融合语义特征的TextRank 关键词抽取方法
2021-10-15杨延娇赵国涛袁振强韩家臣
计算机工程 2021年10期
杨延娇,赵国涛,袁振强,韩家臣
(西北师范大学计算机科学与工程学院,兰州 730070)
0 概述
关键词抽取作为自然语言处理中的一项基础性研究,在信息检索、文本归类、自动摘要等领域得到广泛应用[1],关键词抽取分为有监督的抽取方法与无监督的抽取方法[2]两类。
有监督的关键词抽取方法通过人工标注的方式得到标注集,使用机器学习方法训练语料得到分类器,使用分类器判断文档中的词语是否为关键词[3],典型代表有SVM、Bytes 方法。有监督的关键词抽取方法准确率较高,但需要大量人工参与,难以适用于信息量巨大的现代应用场景。无监督的关键词抽取方法使用某种方式将文档中的词语按重要性进行排序,将排名靠前的词语输出为关键词。无监督的关键词抽取方法基于统计,通过词频、主题特征、文档信息等统计信息筛选出关键词,代表方法包括TF-IDF、LDA、TextRank[4]等。
TF-IDF 方法基于词频,通过计算词语在单文档中的文档频率(Term Frequence,TF)与词语在文档间的逆文档频率(Inverse Document Frequence,IDF)得到词语的综合重要度。TF-IDF 方法计算过程简单,准确率较高,但是纯基于统计,没有考虑句中词语的其他特征,在中文文本关键词抽取领域效率不高[5]。LDA 方法基于隐含主题模型,是一种包括词、主题、文档的三层贝叶斯概率模型[6],其找出文档主题,以主题中出现概率最大的词语作为关键词。LDA 应用广泛,但需要对语料进行预训练,关键词抽取效率在很大程度上取决于训练集文档的主题分布。
TextRank 方法基于词汇图,是Google 著名排序方 法PageRank 的衍生算法[7]。……
登录APP查看全文
