APP下载

高斯加权的重构性K-NN算法研究

2015-04-21刘作国陈笑蓉

中文信息学报 2015年5期
关键词:文本

刘作国,陈笑蓉

(贵州大学 计算机科学与技术学院,贵州 贵阳 550025)



高斯加权的重构性K-NN算法研究

刘作国,陈笑蓉

(贵州大学 计算机科学与技术学院,贵州 贵阳 550025)

该文提出基于高斯加权距离以及聚类重构机制的K-NN文本聚类算法。文章提出K-NN近邻域的概念,通过高斯加权的近邻域算法实施K-NN聚类。利用高斯函数根据样本与聚类中心的距离为样本赋权,计算聚类距离。基于近邻域权重和聚类密度对形成的聚类实施重构,实现聚类数目的自适应调整。使用拆分算子拆分稀疏聚类并调整异常样本;使用合并算子合并相似聚类。实验显示聚类重构机制能够有效地提高聚类的准确率及召回率,增加聚类密度,使得形成的聚类结果更加合理。

文本聚类;K-NN算法;高斯加权;近邻域规则;聚类重构

1 引言

K-NN聚类算法简洁实用,是一类常见的文本聚类算法。K-NN算法选定样本子集形成初始聚类分布,根据初始分布将测试样本划入最近聚类。K-NN算法初始聚类的选择直接影响聚类结果,聚类过程缺少对结果的检测和调整机制,难以实现聚类数目的自适应变更[1]。

本文主要针对K-NN算法的距离判定策略和聚类重构机制进行了研究,通过高斯加权算法实施距离度量,判定样本归属。采用聚类重构机制对不合理聚类实施拆分及合并,实现聚类数目的自适应调整,同时保证形成的聚类更加紧密合理。

2 相关工作

2.1 文本表示

本文主要采用向量空间模型VSM进行文本描述,文本t表示为式(1)。……

登录APP查看全文

猜你喜欢

文本
重点:论述类文本阅读
重点:实用类文本阅读
初中群文阅读的文本选择及组织
作为“文本链”的元电影
在808DA上文本显示的改善
“文化传承与理解”离不开对具体文本的解读与把握
基于doc2vec和TF-IDF的相似文本识别
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
从背景出发还是从文本出发
如何快速走进文本