APP下载

基于权重搜索树改进K近邻的高维分类算法

2021-04-13梁淑蓉陈基漓谢晓兰

科学技术与工程 2021年7期
关键词:分类

梁淑蓉, 陈基漓,2*, 谢晓兰,2

(1.桂林理工大学信息科学与工程学院, 桂林 514004; 2.广西嵌入式技术与智能系统重点实验室, 桂林 514004)

技术的发展促使数据集凸显规模和复杂性,与低维数据相比,高维空间中不同数据之间的相似性概念变得模糊,因此对高维数据的挖掘,机器学习方法将面临严峻考验。一方面,根据数据索引构造的数据挖掘性能减退;另一方面,根据距离度量函数的全维度挖掘失去效果。例如:在高维空间中的K近邻分类算法(Knearest neighbors,KNN),由于数据之间距离的概念不复存在,距待分类数据的最近点和最远点之间的距离几乎相等,使得最近邻计算无法区分最近邻域。如何提高算法的效率是高维数据分类面临的挑战。

针对这一问题,许多学者对高维空间中维数灾难问题开展研究。一类研究通过降维技术去除冗余信息,来实现减少计算量和时间的目的。李勇等[1]提出一种通过可变K近邻局部线性嵌入(locally linear embedding,LLE)降低数据维度的方法,使得即使在维数减小后的特征向量情况下,也可以在高维空间中保留拓扑结构并实现高检索精度。万静等[2]为了降低不确定数据对聚类产生的影响,将数据划分为值不确定和维数不确定,并采用期望公式度量距离,再通过K近邻查询来找寻不确定数据的近似值,此算法具有良好的抗噪声特性和可伸缩性。还有一些研究通过对特征属性进行加权,“忽略”某些属性以实现降维的效果。为了提高高维数据中KNN分类的准确性,Zhu等[3]提出了一种新的KNN方法,该方法实现高维数据的属性选择和属性权重加权,能消除不相关属性并获得原始预测属性的表达式。……

登录APP查看全文

猜你喜欢

分类
分类算一算
垃圾分类的困惑你有吗
星星的分类
我给资源分分类
垃圾分类,你准备好了吗
按需分类
教你一招:数的分类
说说分类那些事
给塑料分分类吧