基于负相关性增强的不平衡多标签学习算法*
2021-09-22程玉胜曹天成王一宾郑伟杰
计算机工程与科学 2021年9期
关键词:分类
程玉胜,曹天成,王一宾,郑伟杰
(1.安徽省高校智能感知与计算重点实验室(安庆师范大学),安徽 安庆 246133; 2.计算智能与信号处理教育部重点实验室(安徽大学),安徽 合肥 230061)
1 引言
多标签学习[1]作为机器学习研究的热点,吸引了大量研究者的关注,并在自动标注、信息检索、个性化推荐等领域得到了广泛应用[2 - 5]。但是,由于标记空间的维数过大,造成了多标签数据的不平衡问题更加突出,严重影响了分类器的性能。也正是由于标签的不平衡性造成了不同标签对样本实例的描述程度存在一定的差异性,有些标签出现的频率较大,能描述大部分的样本;而有些标签仅仅存在于少量样本中,但往往这一小部分的标签却包含了很多的信息。
与平衡数据相比,大多数算法在处理不平衡数据时表现不佳,分类器偏向多数标签,从而在少数标签的判别上会出现更高的错误率,近年来越来越多针对多标签不平衡问题的方法被提出。如,Liu等[6]利用实例的局部标签分布,对数据进行合成过采样,在兼具全局与局部不平衡的同时,提高了分类器的分类精度;Tsai等[7]在处理临床记录文本时,将类别标签进行分层,再加入卷积模型中,不仅提高了识别性能,同时还解决了类别不平衡问题;Lo等[8]利用代价敏感学习方法,为每种标签计算一个错分代价,通过代价值的不同来减少少数标签错分类情况。可见,解决标签不平衡问题是提高多标签分类精度的有效手段。
然而,真实世界中标签和标签之间并非相互独立,往往存在一定的关联性。……
登录APP查看全文
