基于DBSCAN的自适应聚类算法的研究与实现
2021-10-11陈小辉奚庆港
陈小辉, 奚庆港
(淮阴师范学院 计算机科学与技术学院, 江苏 淮安 223300)
0 引言
聚类算法是数据挖掘中的一种技术,而数据挖掘是从一堆数据中挖掘知识[1].聚类分析目前已经被广泛地应用于图像识别、生物学等领域.DBSCAN算法(Density-Based Spatial Clustering of Applicotions with Noise)的优点在于不仅可以发现任意形状的簇,还可以发现噪音点和离群点.由于该算法使用两个全局的参数,使得针对变密度数据集时聚类的效果并不出色,其原因在于DBSCAN算法对两个参数过于敏感且两个参数全局通用,而全局通用的参数较多时候需要人工判别.因此,一些学者针对自适应参数的 DBSCAN 算法进行了研究.Yue等[2]提出一种基于数据统计信息确定Eps参数的算法,通过该算法可以在更广的范围内搜索Eps参数,但是该算法中MinPts参数恒定设置为4的时候,也不能较准确地反映数据集的分布特性. 周红芳等[3]提出了I-DBSCAN(Improved Density-Based spatial Clustering of Applicotions with Noise)自适应聚类算法,利用聚类个数和噪声点个数的趋势作为聚类结果判别,寻找趋势稳定点处所对应的Eps和MinPts参数.但I-DBSCAN自适应聚类算法不足之处还需要人为进行判别.
本文针对DBSCAN算法对密度不同的数据集、符号型数据集聚类效果较差的不足,引入了对象密度的概念和统计学分析方法,得出Eps与MinPts的关系,通过最小二乘法进行函数拟合得到一条曲线,由曲线找到和核心点相近的对象,将其纳入簇内,随后进行不断遍历,最后实现聚类.实验结果表明,改进后的算法与DBSCAN算法及K-MEANS算法相比,对符号型数据集和数值型密度不均匀……