高斯加权的重构性K-NN算法研究
2015-04-21刘作国陈笑蓉
中文信息学报 2015年5期
关键词:文本
刘作国,陈笑蓉
(贵州大学 计算机科学与技术学院,贵州 贵阳 550025)
高斯加权的重构性K-NN算法研究
刘作国,陈笑蓉
(贵州大学 计算机科学与技术学院,贵州 贵阳 550025)
该文提出基于高斯加权距离以及聚类重构机制的K-NN文本聚类算法。文章提出K-NN近邻域的概念,通过高斯加权的近邻域算法实施K-NN聚类。利用高斯函数根据样本与聚类中心的距离为样本赋权,计算聚类距离。基于近邻域权重和聚类密度对形成的聚类实施重构,实现聚类数目的自适应调整。使用拆分算子拆分稀疏聚类并调整异常样本;使用合并算子合并相似聚类。实验显示聚类重构机制能够有效地提高聚类的准确率及召回率,增加聚类密度,使得形成的聚类结果更加合理。
文本聚类;K-NN算法;高斯加权;近邻域规则;聚类重构
1 引言
K-NN聚类算法简洁实用,是一类常见的文本聚类算法。K-NN算法选定样本子集形成初始聚类分布,根据初始分布将测试样本划入最近聚类。K-NN算法初始聚类的选择直接影响聚类结果,聚类过程缺少对结果的检测和调整机制,难以实现聚类数目的自适应变更[1]。
本文主要针对K-NN算法的距离判定策略和聚类重构机制进行了研究,通过高斯加权算法实施距离度量,判定样本归属。采用聚类重构机制对不合理聚类实施拆分及合并,实现聚类数目的自适应调整,同时保证形成的聚类更加紧密合理。
2 相关工作
2.1 文本表示
本文主要采用向量空间模型VSM进行文本描述,文本t表示为式(1)。……
登录APP查看全文
