融合分类信息的随机森林特征选择算法及应用
2021-09-07武炜杰张景祥
武炜杰,张景祥
江南大学 理学院,江苏 无锡214122
从海量特征中科学提取关键特征,达到降维、提升模型性能的效果是机器学习与模式识别的关键问题[1]。特征选择是从原始特征集中选出若干具有代表性的特征子集,且在该特征子集上所构建的分类或回归模型达到与特征选择前近似甚至更好的预测精度。特征选择不仅可以提高应用算法的空间和时间效率,避免“维数灾难”[2],还可以在一定程度上避免算法的过拟合问题。
根据特征评价策略,特征选择方法大致分为两种:过滤式(Filter)和封装式(Wrapper)[3-4]。过滤式方法在数据预处理步骤中对特征排序,设定阈值选择最优特征子集,这种方法独立于后续采取的机器学习算法。过滤式方法中经典的排序准则有Pearson相关系数[5]、互信息[6]、Laplacian得分[7]等。Kira等[8]提出的Relief算法依据特征权重对特征排序,但算法只针对于二分类问题的特征选择。Kononenko[9]在Relief算法的基础上进一步提出了Relief-F算法,可以进行多分类问题的特征选择。Peng等[10]提出mRMR(max-Relevance and Min-Redundancy)算法,保留与分类信息具有强相关性的特征,又在一定程度上去除冗余特征。
封装式方法通过与后续的学习算法结合,根据分类器的准确率分别评价每个特征子集,从而选择最优特征子集。Breiman[11]提出通过随机森林置换特征计算其重要性得分,进行特征选择是典型的封装式方法。但当特征规模较大,不可能对每个特征子集进行评价,所以通常向前或向后算法来引入或消除特征。如Gregorutti等[12]通过研究随机森林模型内决策树之间相关性对特征置换的影响,基于随机森林特征置换计算其重要性得分同时,提出了一种递归特征消除算法;……
