集成学习思想预拟合分类算法
2021-03-23张跃,赵佳,胡明
长春工业大学学报 2021年1期
张 跃,赵 佳,胡 明
(长春工业大学 计算机科学与工程学院,吉林 长春 130012)
0 引 言
随着大数据技术的发展,大数据时代已经到来[1-3]。而大数据的分类一直是大数据研究的热点问题[4-6],常用的分类算法有:朴素贝叶斯(naive bayes)、支持向量机(SVM)、k-近邻算法(KNN)、神经网络(ANN)和决策树,其中决策树凭借结构简单、计算复杂度低、对数据缺值不敏感等优点被广泛应用。它主要依靠每个节点上的属性对划分到该节点中的样本集合进行继续划分,最终落到对应各个决策结果的叶子节点中。即每一个决策树的根节点都包含了所有的样本,每个叶子结点对应着一个类别。但是传统的决策树也有不足之处,主要由于其过于简单,容易发生过拟合,以及不容易感知到特征之间的相互关联,各属性样本数量的平衡情况也会严重影响其分类效果,且判定特征的准则会对结果产生很大影响。
随机森林就是为了解决其中容易过拟合的问题,在2001年被LeoBreiman提出[7]。通过将多个决策树进行有机结合,改变了之前生成决策树时固定的选择样本方式,通过随机采样方法从原始数据样本集中选择多个特征样本,即有放回的抽取样本构建一个样本子集,再使用多个由样本子集构建的决策树分别进行分类,最后将分类结果进行融合。
目前,已经有许多研究者在此基础上进行了改进[8-11]。文献[9]提出使用MapReduce将过采样、欠采样和对成本敏感的学习应用于大数据,以便这些技术能够管理所需的、尽可能大的数据集,从而正确识别样本代表性不足的类别,但是对于直接处理样本代表性不平衡的数据和对特征较少的情况并未多作考虑;……
登录APP查看全文
