一种改进的自适应快速AF-DBSCAN聚类算法
2016-07-01周治平王杰锋朱书伟孙子文
周治平,王杰锋,朱书伟,孙子文
(江南大学 物联网工程学院,江苏 无锡 214122)
一种改进的自适应快速AF-DBSCAN聚类算法
周治平,王杰锋,朱书伟,孙子文
(江南大学 物联网工程学院,江苏 无锡 214122)
摘要:基于密度的DBSCAN聚类算法可以识别任意形状簇,但存在全局参数Eps与MinPts的选择需人工干预,采用的区域查询方式过程复杂且易丢失对象等问题,提出了一种改进的参数自适应以及区域快速查询的密度聚类算法。根据KNN分布与数学统计分析自适应计算出最优全局参数Eps与MinPts,避免聚类过程中的人工干预,实现了聚类过程的全自动化。通过改进种子代表对象选取方式进行区域查询,无需漏检操作,有效提高了聚类的效率。对4种典型数据集的密度聚类实验结果表明,本文算法使得聚类精度提高了8.825%,聚类的平均时间减少了0.92 s。
关键词:密度聚类;DBSCAN;区域查询;全局参数;KNN分布;数学统计分析
中文引用格式:周治平,王杰锋,朱书伟,等.一种改进的自适应快速AF-DBSCAN聚类算法[J]. 智能系统学报, 2016, 11(1): 93-98.
英文引用格式:ZHOU Zhiping,WANG Jiefeng,ZHU Shuwei,et al. An improved adaptive and fast AF-DBSCAN clustering algorithm[J]. CAAI Transactions on Intelligent Systems, 2016,11(1):93-98.
数据挖掘是一种从大量数据中发现感兴趣信息的技术,聚类算法在数据挖掘应用中日益广泛。其中,基于密度的聚类算法可以发现任意形状的簇且能够较好地处理噪声数据,越来越受到广泛的关注。DBSCAN算法能够发现任意形状的簇,并有效识别离群点,但聚类之前需要人工选择Eps和minPts 2个参数。当数据量增大时,要求较大的内存支持,I/O消耗也很大;当空间聚类的密度不均匀,聚类间距离相差很大时,聚类质量较差[1-3]。……
