基于密度RPCL的K.medoids算法
2018-10-21郭文娟
摘 要:针对K.medoids算法需要事先给定聚类数目和初始聚类中心的问题,借助次胜者受罚竞争学习算法RPCL确定数据集的类簇数目,提出以密度RPCL作为预处理步骤的K.medoids聚类算法。通过密度RPCL算法对数据集进行处理,从而确定K.medoids算法的合理类簇数目,然后再运行改进K.medoids算法,由此提高K.medoids算法的聚类效率和聚类准确性。采用UCI机器学习数据库数据集进行实验测试,使用不同的聚类结果评价指标对实验结果进行分析,证明本文基于密度RPCL的K.medoids算法具有很好的聚类效果。
关键词:RPCL算法;K.medoids算法;密度;聚类数目;初始中心
聚类算法是模式识别、机器学习和数据挖掘等领域中一个重要的研究内容,该算法根据一定的相似性准则将样本聚集为若干个类簇。
K.medoids算法是基于划分的聚类算法,该算法用类中心的数据作为中心点来代表类。[1]Park 等人提出一种快速K.medoids 算法,在初始中心点的选择和更新聚类中心上有了改进[2];自行提出改进K.medoids 算法,使所选的初始中心点位于数据集中样本分布密集区域,并且所选初始中心之间的空间距离较远,目的使其位于不同的类簇中。[3]
本文借助于基于密度的次者受罚竞争学习算法[4.6] (RPCL) 来确定最佳的聚类数目值,在此基础上运行改进的K.medoids 算法,从而改善聚类效果。通过UCI 机器学习数据库数据集实验测试,表明基于密度RPCL 的K.medoids 算法具有非常好的聚类效果。
1 密度RPCL算法
竞争学习算法 (Rival Penalized Competitive Learning,RPCL)[4]可以用于确定数据集的类簇数目值,[5.7]但RPCL算法在学习时对学习率和遗忘率非常敏感。……
