APP下载

一种多标记数据的过滤式特征选择框架

2014-11-26郭雨萌李国正

智能系统学报 2014年3期
关键词:特征实验

郭雨萌,李国正

(同济大学电子与信息工程学院控制系,上海201804)

多标记数据[1]中每个样本可以同时带有多个类标,并且广泛地出现在不同的应用领域,比如文本分类、媒体标注、信息检索、生物信息学等。对于这种数据的分析需要利用多标记学习技术[2-3]。由于大量不同的多标记学习技术被提出,所以该技术仍是研究热点,目前可以分为问题转化和算法适应2种类型。在问题转化类型中,BR(binary relevance),CC(classifier chain)和RAkEL(random k-labelsets)分类器是典型代表。而在算法适应类型中,MLkNN(multi-label k nearest neighbor)、AdaBoost.MH(adaboost multi-class hamming trees)和RankSVM(rank support vector machine)属于将一些先进的单标记分类器转化为多标记分类器的一类。LEAD(multi-label learning by exploiting label dependency)和LIFT(multi-label learning with label-specific features)分类器则更进一步,考虑到特征子集和利用类标的层级结构去进行学习分类的一类。多标记学习技术发展的动力来自于实际应用问题,很具有研究价值。

虽然多标记学习技术还需要许多研究工作,但是很少的科研工作者将目光转向数据集中一些不相关或冗余的特征。减少这些特征会在一定程度上提高多标记学习器的分类能力,因此对数据集进行特征选择预处理是很有必要的。特征选择[4-5]的目的是在高维数据中降低子集维度,主要有过滤式、包装式和嵌入式等3种不同形式。过滤式与目标学习器无关,具有计算简单,效率高的优势[6-7]。本文提出一种过滤式多标记特征选择的框架,并以卡方检验[8]为特征评价的准则。

1 过滤式多标记特征选择框架

过滤式方法的基本思想是使用一种独立于分类器的评价指标来衡量某个特征的好坏,即选择该特征优先级。……

登录APP查看全文

猜你喜欢

特征实验
记一次有趣的实验
如何表达“特征”
做个怪怪长实验
不忠诚的四个特征
NO与NO2相互转化实验的改进
实践十号上的19项实验
线性代数的应用特征
《实验流体力学》征稿简则