基于流形距离核的自适应迁移谱聚类算法
2020-09-02齐晓轩洪振麒
计算机应用与软件 2020年8期
关键词:效果
齐晓轩 都 丽 洪振麒
1(沈阳大学应用技术学院 辽宁 沈阳 110044)2(沈阳大学信息工程学院 辽宁 沈阳 110044)
0 引 言
聚类[1-2]作为数据挖掘领域中重要的方法,主要是将同类对象划分为同一簇,不同类对象划分到不同簇的过程。聚类方法有很多种,如C-means、FCM、MECA[3-5]等算法,但这些算法在高斯分布数据集上聚类效果良好,在非高斯分布数据集上聚类效果却不太理想,容易受样本形状影响。谱聚类算法(SC)[6-10]作为一种图论演化而来的算法,不受样本空间形状的制约,且收敛于全局最优解,在一定程度上解决了这个问题。
SC算法首先根据给定的样本集计算任意两点的相似度矩阵W,然后计算特征矩阵,最后使用特征矩阵进行聚类,所以相似度矩阵W的选取直接影响特征矩阵的构造,进而影响聚类效果。Kong等[10]通过建立新的相似图来构造相似度矩阵;ZelnikManor等[13]利用数据点的邻域分布,自动调节尺度参数,增加其泛化能力。Wang等[3]针对相似度矩阵构造存在尺度敏感问题,利用密度差来调整样本点之间的相似度。范子静等[14]利用模糊划分改进谱聚类中硬化分,调整相似性度量函数。以上方法皆是以欧氏距离作为相似性度量方法,无法反映空间分布结构特征。张建朋等[15]通过使用流形距离代替欧氏距离构造相似性矩阵来改进AP算法,较好地解决了数据分布的全局结构问题;Tao等[16]使用流形距离计算相似度矩阵,但没有考虑数据点全部的邻域信息,对于复杂分布点效果依然不理想。
在实际环境中,领域中可用数据的匮乏或者数据受到污染,样本特征信息稀疏,传统的聚类算法很难达到良好效果。……
登录APP查看全文
