APP下载

基于改进k-means算法的数字图像聚类

2020-04-07胡子牧

液晶与显示 2020年2期

高 西, 胡子牧

(重庆医科大学 附属大学城医院,重庆 401331)

1 引 言

随着互联网、5G等技术的飞速进步,可收集的图片数据种类、数量越来越多,数据特征的维度也越来越高。为了从海量图片中快速检索、分类有用的图片,许多研究者将聚类方法用于该领域[1-5]。聚类是模式识别和数据挖掘中的一个重要方向,是一类无监督学习算法,它遵循相似规则将数据样本划分为不同的类,在同一类中的对象之间相似性较高,而在不同类中对象之间相似性较低。到目前为止,很多研究者提出了一些有效的聚类方法,例如k-means[6]、FCM[7]、SOM聚类[8]、AP算法[9]、谱聚类算法[10-13]。其中k-means算法以其对大型数据集的高处理效率而得到了最为广泛的应用。该算法的优点有很多,缺点主要在于:第一,只考虑类内距离,未考虑类间距离;第二,对包含海量样本的数据集的聚类数目上界的确定主要依靠经验,而人为设置的聚类数目上界往往偏大,导致了算法运行效率被降低。

有鉴于k-means算法的第一个缺陷,黄晓辉等[14]提出了一种类内-类间距离加权的k-means算法,该算法的基本思路是,通过在子空间内最大化类中心与其他类内样本点的距离来融合类内和类间距离进行聚类。黄晓辉等在算法中设计了一个目标函数,然后通过求解目标函数来对算法参数进行迭代更新。在真实数据集上的表现证实了该算法相比于现有k-means类算法的优越性。针对传统k-means算法的第二个缺陷导致的聚类数目上界设置偏大,进而导致算法运行效率偏低的问题,周世兵等[15]通过合理设置AP算法的初始参数确定了聚类数目的上界,该方法比传统的经验估计更为有效,大大提升了k-means算法的执行效率。……

登录APP查看全文