融合邻域信息的k-近邻分类
2014-09-13林耀进李进金陈锦坤马周明
林耀进,李进金,,陈锦坤,马周明
(1.闽南师范大学 计算机科学与工程系,福建 漳州 363000; 2. 闽南师范大学 数学与统计学院,福建 漳州 363000)
k-近邻法是一种非常简单有效的分类算法,广泛应用于数据挖掘和模式识别的各个领域[1-3]。其基本思想是通过计算寻找训练集中距离待分类样本最近的k个邻居,然后基于它们的类别信息,依据投票的原则对待分类样本的类别进行判定。k-近邻算法的分类精度很大程度受影响于样本之间距离的度量。
近几年,出现了许多改进的距离度量方法以提高k-近邻算法的分类性能,主要分为局部距离和全局距离两大类。在传统的全局距离度量方面,针对异构特征,提出了相应的距离度量方法,如:值差度量(value difference metric, VDM)、修正的值差度量(modified value difference metric, MVDM) 和异构欧几里德—重叠度量(heterogeneous euclidean-overlap metric, HEOM)等[4-5]。另外,许多学者考虑了样本之间的权重以增强样本之间的相似性。Hu等[6]提出一种通过梯度下降的方法估计样本之间的权重进行改进KNN的分类算法;Wang等[7]提出一种简单的自适应距离度量来估算样本的权重。同时,一些学者通过属性加权或属性选择途径改进距离度量[8-9]。在局部距离度量方面,许多方法利用局部自适应距离处理全局优化问题,如:ADAMENN中的自适应距离,WAKNN中的权重校正度量方法及DANN中的差异化自适应度量方法[10-11]。
上述方法虽能有效地度量样本之间的距离,但基本上都是从单一的距离进行考虑,存在着以下缺点:1)并未考虑样本之间的邻域结构;2)易受噪声的影响;3)不能处理多模态分布问题。……
