基于新的森林优化算法的特征选择算法
2020-06-07程耕国陈和平
谢 琪,徐 旭,程耕国,陈和平
(1.武汉科技大学信息科学与工程学院,武汉430081; 2.格勒诺布尔高等商学院高等商业学院,格勒诺布尔38000,法国)
(∗通信作者电子邮箱85169023@qq.com)
0 引言
特征选择是机器学习和数据挖掘领域研究的热点之一[1]。特征选择是从一组特征中挑选出一些最有效的特征以降低特征空间维数的过程[2-3]。特征选择在数据预处理的过程中会去除冗余和无关的特征,能减轻维度灾难所产生的问题,同时能降低学习任务的难度,提升学习效果[4-5]。在分类问题中,特征选择能提高分类的准确性,能生成更快和更有效的分类器,能更好地了解关键特征的信息[6]。特征选择已被许多学者证明是有效的[7-9]。因此,特征选择是机器学习过程的重要组成部分,可以为之后的学习任务保留有用的特征,同时忽略不相关和不重要的特征[10]。
在2016年,Ghaemi等[11]提出基于森林优化算法的特征选择(Feature Selection using Forest Optimization Algorithm,FSFOA)算法[12],该算法将森林优化算法(Forest Optimization Algorithm,FOA)用于特征选择。FSFOA与基于混合遗传算法的特征选择(Hybrid Genetic Algorithm for Feature Selection,HGAFS)算 法[13]、基 于 粒 子 群 优 化(Particle Swarm Optimization,PSO)算法的特征选择算法[14]和基于支持向量机的 特 征 选 择 算 法[15](a novel Support Vector Machine based feature selection method using a fuzzy Complementary criterion,SVM-FuzCoc)等算法相比取得了不错的效果。FSFOA算法能提高特征学习的准确率,有效地除去冗余特征,并且还具备全局搜索能力。但是FSFOA算法存在一些不足:第一,FSFOA算法初始特征采用随机生成策略,随机初始化策略在非凸函数中可能会陷入局部最优,无法搜索到全局最优;第二,FSFOA算法远处播种使用的是候选森林中的树木,候选森林会产生优劣树不完备问题,影响到全局搜索;……
