APP下载

密度Canopy 的增强聚类与深度特征的KNN 算法

2021-07-22沈学利秦鑫宇

计算机与生活 2021年7期
关键词:分类特征

沈学利,秦鑫宇,2+

1.辽宁工程技术大学 软件学院,辽宁 葫芦岛 125105

2.中国科学院海西研究院 泉州装备制造所,福建 泉州 362216

分类作为数据挖掘领域的重要研究内容之一,对其相关算法的研究已有很长的历史,如今随着Internet 的飞速发展,每天都有大量来自医疗、商业、科学及日常生活等方方面面的数据产生,如何从海量的数据提取有效的信息,这就需要用到某种数据挖掘算法对数据进行分类。目前,比较常见的数据分类算法主要有:支持向量机(support vector machine,SVM)、决策树(decision tree,DT)、朴素贝叶斯(naive Bayes,NB)、深度神经网络(deep neural networks,DNN)、K最近邻(Knearest neighbor,KNN)等。其中K最近邻算法[1]因其在分类任务中简单且效果良好的特点被广泛应用,基本思想是:在向量空间中,通过计算每一条待测样本与训练样本之间的距离(或相似性),从训练样本中找出与待测样本最相似的K个最近邻样本,然后对这K个样本的所属类别进行投票,以此判定待测样本的最终归属类别。然而,当面临高维度大数据量的训练样本时,由于KNN 分类需要逐个计算与训练样本的相似程度,高昂的计算开销使其效率大幅降低。

如何对此进行改进以提高KNN 算法在处理规模较大的高维度样本时的效率,成为数据挖掘领域一个极为关注的问题,对此有不少学者提出了自己的改进算法,大致分为以下几类:

(1)从构造适应数据特性的度量角度提升KNN的性能。文献[2]提出了一种基于Finsler 度量的KNN算法,该算法使用Finsler 作为样本间距离的度量方式,通过分析样本的固有属性,进而赋予样本间距离度量不同的权重,使算法的分类性能得以提升。……

登录APP查看全文

猜你喜欢

分类特征
分类算一算
垃圾分类的困惑你有吗
如何表达“特征”
不忠诚的四个特征
教你一招:数的分类
给塑料分分类吧
线性代数的应用特征