APP下载

基于相关性分析的多标签特征选择方法

2021-12-21孙万彤

关键词:分类特征实验

王 进,孙万彤

(重庆邮电大学 数据工程与可视计算重点实验室,重庆 400065)

0 引 言

近年来,多标签学习[1]在文本分类[2]、蛋白质功能预测[3]、图像标注[4]等领域得到了越来越多的应用,在各种各样的多标签应用中,最主要且最重要的就是对每个样本及其与之相对应的标签进行正确的分类;同传统的分类方法一样,多标签学习同样也面临着维度灾难的问题,尤其对于文本多标签数据,特征数量往往成千上万,其中存在大量冗余或不相关的特征[5],极易引发“维数灾难”,使得模型复杂度和计算时间大大增加;而特征选择是从原始特征集中,按照某一评价准则[6-7]选择出一组具有良好区分特性的特征子集,能剔除冗余或不相关的特征,从而达到降低特征维度,缩小特征空间,提高模型精确度,减少运行时间的目的,同时,选取出的特征更有利于模型理解与数据分析。

传统的机器学习问题中,特征选择方法包括包裹式(嵌入式)、过滤式特征选择方法,其中包裹式(嵌入式)特征选择方法,采用分类器性能评价特征子集的优劣,具有较高的计算复杂度、较大的内存空间;过滤式特征选择方法采用特定评价标准评价特征子集的优劣,独立于分类器,计算快且简单,所以一般常用过滤式特征选择方法进行特征选择,常见单标签特征选择[8-9]框架如图1。

图1 特征选择框架Fig.1 Feature selection framework

在多标签特征选择[10-11]中,同样也存在以上几种特征选择方法,过滤式特征选择也是被用得最多的,在过滤式特征选择中,卡方检验[12](Avg.CHI)是通过计算所有特征和标签之间的方差,综合每个标签所选出来的特征的方差得出每个特征的重要性;……

登录APP查看全文

猜你喜欢

分类特征实验
记一次有趣的实验
分类算一算
如何表达“特征”
做个怪怪长实验
不忠诚的四个特征
教你一招:数的分类
NO与NO2相互转化实验的改进
实践十号上的19项实验
线性代数的应用特征