APP下载

基于改进粒子群优化的文本聚类算法研究

2014-06-07王永贵刘宪国

计算机工程 2014年11期
关键词:文本优化

王永贵,林 琳,刘宪国

(辽宁工程技术大学软件学院,辽宁葫芦岛125105)

基于改进粒子群优化的文本聚类算法研究

王永贵,林 琳,刘宪国

(辽宁工程技术大学软件学院,辽宁葫芦岛125105)

针对k-means算法的聚类结果高度依赖初始聚类中心选取的问题,提出一种基于改进粒子群优化的文本聚类算法。分析粒子群算法和k-means算法的特点,针对粒子群算法搜索精度不高、易陷入局部最优且早熟收敛的缺点,设计自调节惯性权重机制及云变异算子以改进粒子群算法。自调节惯性权重机制根据种群进化程度,动态地调节惯性权重,云变异算子基于云模型的随机性和稳定性,采用全局最优值实现粒子的变异。该算法结合了粒子群算法较强的全局搜索能力与k-means算法较强的局部搜索能力。每个粒子是一组聚类中心,类内离散度之和的倒数是适应度函数。实验结果表明,该算法是一种精确而又稳定的文本聚类算法。

粒子群优化;自调节惯性权重机制;进化程度;云变异算子;k-means算法;文本聚类

1 概述

文本信息量随着互联网不断的发展日益膨胀,人们亟需对这些庞大而又复杂的文本信息进行高效的组织和整理,以便能有效地定位满足用户需求的信息,文本挖掘是解决这类问题的主要技术。聚类是数据挖掘、模式识别研究的重要内容之一[1]。文本聚类的目标是将文本划分成若干个簇,使相同簇之间的内容相似度尽可能大,而不同簇之间的内容相似度尽可能小。……

登录APP查看全文

猜你喜欢

文本优化
超限高层建筑结构设计与优化思考
民用建筑防烟排烟设计优化探讨
关于优化消防安全告知承诺的一些思考
一道优化题的几何解法
由“形”启“数”优化运算——以2021年解析几何高考题为例
初中群文阅读的文本选择及组织
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化