APP下载

稀疏约束的嵌入式模糊均值聚类算法

2021-01-13王继奎杨正国易纪海刘学文王会勇聂飞平

复旦学报(自然科学版) 2020年6期
关键词:模型

王继奎,杨正国,易纪海,刘学文,王会勇,聂飞平

(1.兰州财经大学 信息工程学院,甘肃 兰州 730020;2.桂林电子科技大学 数学和计算科学学院,广西 桂林 541004;3.西北工业大学 光学影像分析与学习中心,陕西 西安 710119)

聚类分析是机器学习领域研究的热点之一,被广泛应用在图像识别[1]、文本分析[2-3]和客户关系管理[4]等领域中.K-Means[5]是其中最经典的聚类算法.K-Means算法聚类速度快,性能好.然而,K-Means计算出的类簇中心并不是实际存在的数据.作为K-Means的替代算法,Kmedoids[6]选择离计算出的类簇中心最近的样本作为类簇中心.尽管K-Means算法计算速度快,被广泛使用,但是也具有若干缺点,比如对异常点敏感,鲁棒性不强及仅适用于球形分布的数据等.为了解决这些问题,研究者们进行系列研究[7-12].文献[13-16]对K-Means算法进行扩展完成分类属性数据、混合类型数据聚类.

K-Means算法属于硬划分,在优化的过程中容易出现划分不准确等问题.为解决这一问题,研究人员提出了模糊均值聚类算法(Fuzzy C-Means,FCM)[17].FCM被广泛应用于各个领域,大大提升了聚类能力.然而FCM算法仍然具有对异常点敏感,鲁棒性不强,仅适用于球形分布的数据等问题.研究人员在FCM算法的基础上,又提出了Kernel based FCM[18]、Multivariate FCM、Modified probabilistic FCM[19]、Conditional spatial FCM[20]、Generalized entropy-based physicalistic FCM[21]等算法.

随着科技的发展,高维数据不断涌现.机器学习算法在面对高维数据时,产生了维度灾难问题,比如计算复杂度高.在许多场合,尽管数据的维度很高,但是有意义的数据分布往往嵌入在某个低维子空间中.降维技术不仅能使高维数据更好地被理解……

登录APP查看全文

猜你喜欢

模型
一半模型
一种去中心化的域名服务本地化模型
适用于BDS-3 PPP的随机模型
函数模型及应用
p150Glued在帕金森病模型中的表达及分布
函数模型及应用
重尾非线性自回归模型自加权M-估计的渐近分布
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
一个相似模型的应用