APP下载

基于网络社区发现的标签传播聚类算法①

2021-01-21吴清寿余文森

计算机系统应用 2020年12期

吴清寿,郭 磊,余文森

1(武夷学院 数学与计算机学院,武夷山 354300)

2(武夷学院 认知计算与智能信息处理福建省高校重点实验室,武夷山 354300)

3(智慧农林福建省高校重点实验室,福州 350002)

大数据时代,各个领域时刻都在产生大量的数据,这些数据通常都是无标签的,要确定每一个样本的标签通常是困难的.机器学习算法中的无监督学习可以对无标签的数据进行学习,以期能够揭示数据之间的联系或存在的内在规律.聚类算法是无监督学习的代表,可通过数据的相似属性将数据进行分组,帮助人们增进对数据的理解,如利用聚类技术发现具有类似功能的基因组,检测疾病的时空分布模式等.

传统的聚类算法可大致划分为基于划分的方法,基于层次的方法,基于密度的方法,基于谱图划分的方法和其他方法[1].K-means 是分割聚类的最早也是最出名的研究,其对初始的质心选择有较强的依赖性,且倾向于寻找圆形集簇.K-means 只考虑了连通性,Kuwil等[2]提出一种重心聚类算法(Gravity Center Clustering,GCC),同时兼顾连通性和内聚性,且无需提供聚类的簇数.基于密度的方法中,DBSCAN (Density-Based Spatial Clustering of Application with Noise)[3]可以对任意形状的数据聚类,但确定其半径和包含的样本数量是一个难点,且在簇间混合度较大时对样本标签误判的概率较高.郭艳婕等[4]提出一种改进的GS-DBSCAN 算法,通过计算数据的分布特性,可自适应确定半径和半径内包含的样本数。层次聚类算法包括分裂法和凝聚法,其中,CURE (Clustering Using REpresentative)算法[5]能够处理形状和尺寸差别较大……

登录APP查看全文