APP下载

基于DBSCAN的自适应聚类算法的研究与实现

2021-10-11陈小辉奚庆港

淮阴师范学院学报(自然科学版) 2021年3期
关键词:定义

陈小辉, 奚庆港

(淮阴师范学院 计算机科学与技术学院, 江苏 淮安 223300)

0 引言

聚类算法是数据挖掘中的一种技术,而数据挖掘是从一堆数据中挖掘知识[1].聚类分析目前已经被广泛地应用于图像识别、生物学等领域.DBSCAN算法(Density-Based Spatial Clustering of Applicotions with Noise)的优点在于不仅可以发现任意形状的簇,还可以发现噪音点和离群点.由于该算法使用两个全局的参数,使得针对变密度数据集时聚类的效果并不出色,其原因在于DBSCAN算法对两个参数过于敏感且两个参数全局通用,而全局通用的参数较多时候需要人工判别.因此,一些学者针对自适应参数的 DBSCAN 算法进行了研究.Yue等[2]提出一种基于数据统计信息确定Eps参数的算法,通过该算法可以在更广的范围内搜索Eps参数,但是该算法中MinPts参数恒定设置为4的时候,也不能较准确地反映数据集的分布特性. 周红芳等[3]提出了I-DBSCAN(Improved Density-Based spatial Clustering of Applicotions with Noise)自适应聚类算法,利用聚类个数和噪声点个数的趋势作为聚类结果判别,寻找趋势稳定点处所对应的Eps和MinPts参数.但I-DBSCAN自适应聚类算法不足之处还需要人为进行判别.

本文针对DBSCAN算法对密度不同的数据集、符号型数据集聚类效果较差的不足,引入了对象密度的概念和统计学分析方法,得出Eps与MinPts的关系,通过最小二乘法进行函数拟合得到一条曲线,由曲线找到和核心点相近的对象,将其纳入簇内,随后进行不断遍历,最后实现聚类.实验结果表明,改进后的算法与DBSCAN算法及K-MEANS算法相比,对符号型数据集和数值型密度不均匀……

登录APP查看全文

猜你喜欢

定义
活用定义巧解统计概率解答题
例谈椭圆的定义及其应用
题在书外 根在书中——圆锥曲线第三定义在教材和高考中的渗透
永远不要用“起点”定义自己
严昊:不定义终点 一直在路上
定义“风格”
成功的定义
有壹手——重新定义快修连锁
修辞学的重大定义
山的定义