基于样本邻域保持的代价敏感特征选择*
2018-04-13余胜龙
数据采集与处理 2018年2期
余胜龙 赵 红
(闽南师范大学粒计算及其应用重点实验室,漳州,363000)
引 言
在当前的数据时代,无论在数量还是在维度上,数据的产生都是多种多样的,而且数据也越来越大。如在医学、天文和文本等领域,高维数据给数据分析带来了诸多挑战。因此,数据降维[1]成为机器学习中一个必不可少的过程,而特征选择是主要的降维技术之一。特征选择是通过选取能表示所有特征的一个较小的特征子集。从数据是否带有标签来看,特征选择可以分为有监督和无监督两种。有监督的特征选择是利用标签信息评价特征的重要度来进行选择,运用比较广泛的有监督特征选择算法有Fisher Score[2],Relief和ReliefF[3]。无监督的特征选择算法[4]是根据自己数据特征的关系来进行特征选择。
一部分有监督特征选择算法以追求高精度为目的,却忽略了误分类代价或默认误分类代价相同。然而,在现实应用中,不同的误分类通常会导致不同的误分类代价。例如,在交易过程中存在两种类型的误分类。类型Ⅰ定义为将正常交易误分为欺骗交易;类型Ⅱ定义为将欺骗交易误分为正常交易。类型Ⅰ的错误代价是工作人员重新审查交易;类型Ⅱ的错误代价是造成了巨大的金钱损失。显然,类型Ⅰ导致的错误代价要小于类型Ⅱ导致的错误代价。另一部分有监督特征选择算法以选择有益的特征为目标,假设不同类别的样本具有相等的权重,这种认为数据本身有均衡样本类别的想法会导致在数据具有不均衡的样本类别时,有监督特征选择算法的效果大打折扣。……
登录APP查看全文
