APP下载

一种基于属性加权的快速聚类算法∗

2021-06-02赵国伟蔡江辉杨海峰荀亚玲

计算机与数字工程 2021年5期
关键词:实验

赵国伟 蔡江辉 杨海峰 荀亚玲

(太原科技大学计算机科学与技术学院 太原 030024)

1 引言

聚类分析[1~3]是数据挖掘中重要的无监督学习技术之一,与监督学习不同的是待处理的样本数据集中没有包含样本分类相关信息。聚类是把数据集中的对象划分成多个簇的过程,被广泛应用于市场研究、图像分割、网络安全及模式分类等众多新兴领域中。

K-means是一种经典的基于划分的聚类方法,由于其具有简单性和高效性被广泛运用于解决各种现实问题,例如文本分析、图像聚类、社区发现等[4]。此外,K-means采用距离作为相似性的评价指标,所以在处理数值型数据时能够更好地体现聚类在几何和统计上的意义。但是,常用的距离度量方法并没有对样本数据集各属性的内部结构以及其影响聚类划分的情况进行详细分析,即在对样本数据集进行划分时将数据所有属性的重要程度视为相同或者根据经验知识对属性的重要程度进行加权后再计算样本间的相似性。这样计算的距离并没有准确地反映数据间的相似性或因为经验知识不全面而产生误差,从而影响聚类的划分结果。针对传统K-means没有考虑属性重要程度的问题,本文提出了一种改进K-means算法,即FAWK。该算法定义了一个可以在领域知识未知的情况下区分数据属性重要程度的离散度函数,基于离散度函数提出了一种属性特征加权的距离度量方法,即AW(Attribute Weighting Distance)。在AW的基础上结合K-means算法思想提出了FAWK。

2 相关研究

经典K-means是一种简单有效的数据挖掘技术,其主要通过两个迭代步骤进行聚类:其一,根据目前数据划分情况来确定聚类中心;……

登录APP查看全文

猜你喜欢

实验
记住“三个字”,写好小实验
记一次有趣的实验
有趣的实验
做个怪怪长实验
NO与NO2相互转化实验的改进
实践十号上的19项实验
《实验流体力学》征稿简则
我实验,我快乐