APP下载

一类连续的K-means 等价聚类模型及其优化算法*

2021-11-22刘瑞华魏正元

计算机工程与科学 2021年11期
关键词:优化模型

谢 挺,刘瑞华,魏正元

(1.重庆理工大学理学院,重庆 400054; 2.重庆理工大学人工智能学院,重庆 400054)

1 引言

随着计算机和互联网技术的迅猛发展和快速普及,特别是信息数字化、移动终端和云计算等应用领域的不断扩大,各行业所采集的数据量都呈爆炸式增长,时时刻刻都产生着高维的海量数据,人们正进入一个以“大数据”为代表的人工智能新时代。这意味着传统的计算和分析极限不断受到挑战,这也意味着亟需探索新的数据处理技术和方法,这更意味着数据和信息科学发展的新机遇。聚类作为一种非监督学习方法,是数据分析领域的重要研究内容之一。聚类分析是指利用相似性度量将数据划分为不同的类以发现其中隐藏的结构特征并提取有效信息的过程,其中同一类数据点具有最大相似性,不同类数据点具有最小相似性[1]。聚类分析被广泛应用于模式识别、机器学习、图像处理和人工智能等领域。

K-means算法是一类基于划分的聚类算法,以欧氏距离作为相似性度量,其主要思想是最小化类内数据点到聚类中心的欧氏距离的平方和。从本质上讲,K-means 是一个组合优化问题,具有NP复杂度,主要适用于服从Gauss分布的数据集的聚类。因其简洁性和有效性,K-means仍是当前广泛使用的聚类算法,是十大经典数据挖掘算法之一[2]。具体模型可以描述为:对于给定原始数据X={x1,x2,…,xn}∈Rm×n,其中n是样本点数,m是样本点维数,模型如式(1)所示:

(1)

为使K-means能够应用于大数据聚类分析,本文结合大数据问题中普遍存在的稀疏性要求,从聚类问题的本质出发,设计了一种与K-means等价的连续的聚类模型;……

登录APP查看全文

猜你喜欢

优化模型
一半模型
超限高层建筑结构设计与优化思考
民用建筑防烟排烟设计优化探讨
关于优化消防安全告知承诺的一些思考
一道优化题的几何解法
由“形”启“数”优化运算——以2021年解析几何高考题为例
重尾非线性自回归模型自加权M-估计的渐近分布
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
基于低碳物流的公路运输优化