基于Hadoop平台的改进KNN分类算法并行化处理
2018-11-21马莹,赵辉,崔岩
长春工业大学学报 2018年5期
关键词:分类
马 莹, 赵 辉, 崔 岩
(长春工业大学 计算机科学与工程学院, 吉林 长春 130012)
0 引 言
随着科技的快速发展和大数据时代的到来,各领域的社交媒体都在时刻产生大量的数据,而这些数据都存在着潜在的价值[1]。当前,数据挖掘作为发现数据库中有价值数据的关键技术,引起了广大学者的高度关注[2]。数据挖掘是指从庞大的数据量中发现隐藏在其中有价值的数据信息的过程,在市场分析、信息统计、科学探索等方面都得到了广泛应用。常用的传统分类算法有:支持向量机(Support Vector Machine, SVM)、K-最近邻(K-Nearest Neighbors, KNN)、朴素贝叶斯(Naive Bayes, NB)等。其中KNN分类算法有着思想简单、理论成熟、易于实现、准确度高等优点,因此被广泛应用于各领域的数据挖掘中。但是传统的KNN分类算法也存在着以下缺点:
1)传统的KNN分类算法作为文本分类中被广泛应用的算法之一,在分类过程中,要计算每一个测试样本与训练样本集中每一个点相似度或距离,因此,在此过程中会由于计算量庞大而耗费大量的时间,最后导致分类速度减慢,算法的时间复杂度增高,分类效率降低。
2)如果训练样本集处于不均匀状态,那么最终会导致分类的结果不准确。然而,随着各领域的数据量不断增加,传统分类算法已经不能满足当前的数据分析需求,因此,提高算法的分类时间和分类准确性是当前数据分类至关重要的问题。
如今,已有很多研究者对KNN分类算法进行了相关的探究和分析。任朋启等[3]通过对训练样本集高密度的部分进行了剪裁,并对剪裁后的训练样本集进行了投影寻踪理论,提出了一种改进的KNN分类算法----IKNN分类算法,从而提高了分类的准确性。……
登录APP查看全文
