基于改进ReliefF的无监督特征选择方法①
2018-04-21丁雪梅王汉军王炤光周心圆
计算机系统应用 2018年3期
丁雪梅, 王汉军, 王炤光, 周心圆
1(中国科学院 沈阳计算技术研究所,沈阳 110168)
2(中国科学院大学,北京 100049)
3(国家电网公司东北分部,沈阳 110180)
4(吉林大学 计算机科学与技术学院,长春 130000)
特征选择是指从原始特征集中选出一个使得评估标准达到最优的特征子集的过程[1]. 对于一个概念学习问题,优秀的学习样本是训练分类器的关键,样本中的不相关或冗余特征会使学习算法陷入混乱导致分类器过拟合[2],影响训练性能. 因此有效的特征选择对于加速学习速度和提高概念质量具有重要作用.
特征选择根据是否包含类别信息分为有监督的特征选择和无监督的特征选择. 无监督特征选择的目的是根据一定的评判标准,选择出一个足够简练又能够充分描绘原始特征集的重要特性同时保障数据集原生分类性的特征子集. 针对无监督特征选择,已经提出了一些方法,根据是否于后续的学习方法相关,可分为过滤式(Filter) 和封装式(Wrapper)两种[3]. Filter模型独立于学习算法,利用所有训练数据的统计性能,选取相关性评价准则进行特征评估. 文献[4]引入核空间距离测度,通过计算两类样本点在核空间的距离度量相关性,有效提高了线性不可分数据的特征选择能力. 文献[5]采用互信息来度量相关性,以此达到无监督最小冗余最大相关(UmRMR)的特征选择的标准. 文献[6]使用拉普拉斯分值评价特征的重要程度,以极大程度保留原始特征集和整体几何结构信息为原则选……
登录APP查看全文
