APP下载

改进灰狼优化算法的K-Means文本聚类

2021-01-11潘成胜吕亚娜杜秀丽邱少明

计算机工程与应用 2021年1期
关键词:文本

潘成胜,张 斌,吕亚娜,杜秀丽,邱少明

大连大学 通信与网络重点实验室,辽宁 大连116622

随着大数据时代的不断推进,各类文字信息充斥于人们视野中,但其中有用的信息不易被发现,聚类方法凭借其聚类速度快、效果明显等优点广泛应用于文本信息挖掘[1-2]。文本聚类的目的是将非结构化的文本数据分成多个类簇,其中同类簇文本相似度高,不同类簇文本相似度低[3]。K-Means 算法作为最经典的聚类算法,在文本聚类中应用广泛;但K-Means 算法也存在局限性,如对初始聚类中心要求过高,算法易收敛到局部最小值等,以致文本聚类结果不可靠[4-6]。

研究人员对K-Means 文本聚类算法作了改进,如:文献[7]将粒子群算法与K-Means 算法结合进行文本文档聚类分析,改善了K-Means算法的文本聚类效果不佳的缺陷;文献[8]使用核函数对K-Means 算法进行改进,并对改进后的K-Means算法进行文本聚类划分,改善了传统K-Means算法的部分缺点;文献[9]对词语间的相似性计算进行了修正,来改进K-Means 算法,具有一定的文本聚类效果;文献[10]使用密度峰值对K-Means 算法优化进行文本聚类,但是未从本质上解决K-Means算法容易陷入局部最优的问题,致使文本聚类效果可靠性降低。

Mirjalili等[11]在2014年提出了灰狼优化(Grey Wolf Optimizer,GWO)算法作为一种新型的群智能算法,较粒子群算法、蝙蝠算法等有更优秀的收敛速度与搜索能力,部分研究人员也将GWO 算法与K-Means 算法结合进行聚类分析:文献[12]开发了一种基于GWO 算法的聚类算法来提高聚类性能;文献[13]提出了一种具有Powell 局部优化的GWO 聚类算法,在多数数据集上优于其他算法。……

登录APP查看全文

猜你喜欢

文本
重点:论述类文本阅读
重点:实用类文本阅读
初中群文阅读的文本选择及组织
作为“文本链”的元电影
在808DA上文本显示的改善
“文化传承与理解”离不开对具体文本的解读与把握
基于doc2vec和TF-IDF的相似文本识别
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
从背景出发还是从文本出发
如何快速走进文本