基于模糊数学的高维稀疏数据聚类统计方法设计
2021-10-24周燕茹
吉林化工学院学报 2021年9期
周燕茹
(巢湖学院 数学与统计学院,安徽 巢湖 238000)
随着数据库管理系统的应用范围越来越广,企业或其他机构均积攒了海量数据[1].对数据实施聚类统计处理能够判断数据间的相似度,从而获取重要的数据特征信息.然而,数据维度与稀疏度成反比,数据对象会分布于各个维度子空间内,传统的聚类方法在这方面的聚类效果较差,原因是距离函数容易无效、算法复杂度高与聚类中心选择过于随机等[2-3].且传统的数据分析工具仅具备查询与统计等作用,难以高效聚类高维稀疏数据.
一直以来,高维稀疏数据聚类统计方法始终是数据挖掘方面的一大难题[4].邵俊健[5]等人针对高维数据聚类效果较差问题,设计了一种具有抗噪性能适用高维数据的增量式聚类统计方法,提升其抗噪性能与聚类效果;武森[6]等人针对数据对象易于划分至更大类内问题,设计了一种基于拓展差异度的高维数据聚类统计方法,有效缩短聚类时间.然而在实际应用中发现,随着现阶段数据量及其复杂度的提高,上述两种方法在聚类统计稀疏度较低的数据集时效果仍然较差.
模糊数学是一种分析模糊性情况的数学方法,主要用于模糊聚类分析与模糊综合评判等.其中,最为常用的是模糊C均值算法(Fuzzy C-means,FCM).为此,本研究以FCM算法为基础,设计了基于模糊数学的高维稀疏数据聚类统计方法,以期提升聚类统计效果.
1 高维稀疏数据聚类统计方法设计
1.1 FCM算法
FCM算法……
登录APP查看全文
