基于LightGBM 的文本关键词提取方法
2021-08-02马莉媛朱良奇黄季涛李梦君荆苗苗
软件导刊 2021年7期
马莉媛,黄 勃,朱良奇,黄季涛,李梦君,荆苗苗
(上海工程技术大学电子电气工程学院,上海 201620)
0 引言
移动互联网快速发展与大数据、云计算等技术的出现催生了众多新媒体发展,公众获取信息的渠道逐渐增加,信息获取愈加便利。但有些媒体为了吸引用户眼球,追求更高的点击率,对文章标题过度润色,部分文章甚至出现文不对题的现象。用户在信息检索时多用文本标题进行检索,由于信息过载、垃圾信息过多导致无法快速找到精准信息等问题。面对繁杂的信息,可利用关键词提取技术快速且精准地提炼文本信息。
关键词提取指从文本中提取与目标内容最相关的词汇,被提取的关键词必须具备3 个条件:可读性、相关性及涵盖性。1958 年Luhn[1]提出了题内关键字索引的概念,使检索刊物时对索引的编辑工作实现自动化,加快了检索刊物的出版速度,保证了文献报道及时性;1999 年,Witten等[2]提出一种KEA 全新算法,该算法主要是利用候选目标关键词第一次处在文档内的位置与TF-IDF 值进行匹配从而获得特征值,然后使用贝叶斯模型训练获得关键词;2000 年,Turney[3]采用C4.5 决策树分类器进行关键词提取;Mihalcea 等[4]基于PageRank 算法与单词之间的语义关系,提出基于图模型的Texrank 算法,该算法精度较高,考虑了词的位置信息,但是计算复杂度较高;徐文海等[5]提出了一种基于向量空间模型与TF-IDF 方法的中文关键词抽取算法。该算法在对文本进行自动分词后,用TF-IDF 方法对文献空间中的每个词进行权重计算,然后根据计算结果抽取出科技文献关键词,这种方法较易理解,且容易实现,但是过度依赖语料库,精度不高,没有考虑语义信息;……
登录APP查看全文
