基于扩展自然邻居的无参分类方法*
2021-09-22曹文态杨德刚
计算机工程与科学 2021年9期
曹文态,杨德刚,2,冯 骥,2
(1.重庆师范大学计算机与信息科学学院,重庆 401331; 2.教育大数据智能感知与应用重庆市工程研究中心(重庆师范大学),重庆 401331)
1 引言
近些年来,伴随着工程和科学领域的持续发展,现实生活中产生了大量的可用数据。但是,随着数据量的增加,利用传统数据分析方法从海量数据中进行模式识别变得相对困难。作为数据挖掘领域的重要方法,分类分析方法已经被广泛地运用于实际应用中的数据分析。在进行分类分析时,几乎所有现有的分类器都是基于大量参数的,这些参数的设置也往往需要领域专家的先验知识。随着大数据时代的到来[1 - 4],由于许多分类问题数据集中的数据分布通常都是未知的或者很难获得的,因此更需要进行分类分析过程中的去参数研究。作为非参数分类器的典型代表之一,k-最近邻kNN(k-Nearest Neighbor)分类器是从训练集中找到和测试样本最接近的k个训练样本,然后根据k个邻居的主要分类信息来预测测试样本的类别[5,6]。由于其模型的简单性和高效性,kNN分类器成为了分类分析领域应用范围最广的方法之一。
由于kNN分类器工作机制简单且效果相对较好,吸引了众多研究者投入研究[7],并将其应用于各个领域[8 - 10]。因此,kNN在许多不同学科中都有大量的应用[11 - 14]。然而,在使用kNN分类器的过程中还存在以下2个问题:
(1)kNN分类器的效率很大程度上取决于选择的距离测度的类型,尤其是在大型高维数据库中更为明显。在某些应用中,数据结构非常复杂,因此相应的距离测量在计算上需要非常大的花销[15,16]。……
登录APP查看全文
