基于空间变换的随机森林算法
2021-11-05关晓蔷王文剑庞继芳孟银凤
关晓蔷 王文剑,2 庞继芳 孟银凤
1(山西大学计算机与信息技术学院 太原 030006) 2(计算智能与中文信息处理教育部重点实验室(山西大学) 太原 030006) 3(山西大学数学科学学院 太原 030006) (gxq0079@sxu.edu.cn)
互联网、大数据、云计算与物联网等信息技术的快速发展和深度融合对机器学习提出了新的挑战,如何对收集到的大量信息进行快速准确分类,以便获取有价值的知识,成为当前机器学习领域关注的焦点之一.常用的分类算法有随机森林(random forest, RF)[1]、支持向量机、神经网络等.其中,随机森林凭借其预测准确度高、抗噪能力强、能够处理高维数据、容易实现并行化等优势,在行为识别[2]、入侵检测[3]、医学研究[4]、图像处理[5]、文本分类[6]、情感识别[7]等实际问题中得到了广泛的应用.
随机森林是Breiman在2001年提出的一种机器学习算法[1].该算法在以决策树[8-9]为基分类器构建Bagging[10]集成的基础上,引入了训练数据集随机化[11]和属性集随机化这2种随机性,使得随机森林不易陷入过拟合,且具有很好的抗噪能力.Fernandez-Delgado等人[12]对179种分类算法在121个UCI数据集上的分类性能进行了实验分析,结果表明随机森林是这179种分类算法中表现最好的.由于随机森林容易实现且性能优越,近年来受到了学者们的广泛关注[13-14].Abellán等人[15]将非精确信息增益作为属性选择的标准,建立了基于非精确概率理论的随机森林算法(credal random forest, CRF).Wang等人[16]使用2个独立的伯努利分布来简化决策树的构建,从而提出了伯努利随机森林(Bernoulli random forest, BRF).Quadrianto等人[17]提出一种Safe-Bayesian随机森林来提高随机森林……
