基于改进粒子群优化的文本聚类算法研究
2014-06-07王永贵刘宪国
计算机工程 2014年11期
王永贵,林 琳,刘宪国
(辽宁工程技术大学软件学院,辽宁葫芦岛125105)
基于改进粒子群优化的文本聚类算法研究
王永贵,林 琳,刘宪国
(辽宁工程技术大学软件学院,辽宁葫芦岛125105)
针对k-means算法的聚类结果高度依赖初始聚类中心选取的问题,提出一种基于改进粒子群优化的文本聚类算法。分析粒子群算法和k-means算法的特点,针对粒子群算法搜索精度不高、易陷入局部最优且早熟收敛的缺点,设计自调节惯性权重机制及云变异算子以改进粒子群算法。自调节惯性权重机制根据种群进化程度,动态地调节惯性权重,云变异算子基于云模型的随机性和稳定性,采用全局最优值实现粒子的变异。该算法结合了粒子群算法较强的全局搜索能力与k-means算法较强的局部搜索能力。每个粒子是一组聚类中心,类内离散度之和的倒数是适应度函数。实验结果表明,该算法是一种精确而又稳定的文本聚类算法。
粒子群优化;自调节惯性权重机制;进化程度;云变异算子;k-means算法;文本聚类
1 概述
文本信息量随着互联网不断的发展日益膨胀,人们亟需对这些庞大而又复杂的文本信息进行高效的组织和整理,以便能有效地定位满足用户需求的信息,文本挖掘是解决这类问题的主要技术。聚类是数据挖掘、模式识别研究的重要内容之一[1]。文本聚类的目标是将文本划分成若干个簇,使相同簇之间的内容相似度尽可能大,而不同簇之间的内容相似度尽可能小。……
登录APP查看全文
