APP下载

参数独立的加权局部均值伪近邻分类算法

2021-07-02蔡瑞光张德生肖燕婷

计算机应用 2021年6期
关键词:分类

蔡瑞光,张德生,肖燕婷

(西安理工大学理学院,西安 710054)

(∗通信作者电子邮箱2151577901@qq.com)

0 引言

数据挖掘[1]是在大型数据存储中自动发现有用信息的过程,分类属于数据挖掘的四大任务之一。分类器能够把数据集中的测试样本映射到特定类别的分类函数或分类模型,已被广泛应用于文字以及人脸识别、医学、文本分类、商务、图像处理、自然语言理解、垃圾邮件识别等领域。

局部均值K近邻(Local Mean-basedK-Nearest Neighbor,LMKNN)算法是文献[2]提出的一种经典的分类算法,其核心思想是先找到待分类样本在训练集中每类样本中的k个近邻的局部均值点,再将测试样本分到离它最近的局部均值点所属的类别。伪近邻(Pseudo Nearest Neighbor rule for pattern classification,PNN)算法是文献[3]提出的一种用伪最近邻代替真正最近邻的分类算法,首先找到待测样本在每类训练样本中的伪最近邻,再将其分到距离测试样本最近的伪最近邻所属于的类。局部均值伪最近邻(Local Mean-based Pseudo Nearest Neighbor,LMPNN)算法[4]是将经典的局部均值K近邻(LMKNN)算法和伪最近邻(PNN)算法相结合,充分利用了样本的局部信息,降低了离群点对分类结果的影响。该算法的主要特点是简单、快速且易于实现,至今仍被广泛地应用。但该算法也有明显的不足之处,参数的设置具有主观敏感性,分类结果受k值的影响较大;将每个属性值和类别均同等对待,忽略了每个属性值和类别对分类结果的不同程度的影响。因此,确定最佳k值和属性权重成为众多学者的研究方向。

针对LMPNN 算法存在的不足之处,文献[5]提出了基于局部均值与类均值的近邻分类算法,该算法利用测试样本对每个训练类中k个近邻的局部均值的信息和整体均值的信息进行预测分类。……

登录APP查看全文

猜你喜欢

分类
分类算一算
垃圾分类的困惑你有吗
星星的分类
我给资源分分类
垃圾分类,你准备好了吗
按需分类
教你一招:数的分类
说说分类那些事
给塑料分分类吧