基于重采样与属性约简的多模态选择性集成学习
2021-05-20张友强杨爱光
计算机工程与设计 2021年5期
关键词:分类
江 峰,李 瑞,张友强,杨爱光
(青岛科技大学 信息科学技术学院,山东 青岛 266061)
0 引 言
集成学习的目的是训练多个不同的个体分类器,并通过某种组合策略(例如,投票)将这些个体分类器集成在一起,从而生成泛化能力更强的集成分类器[1,2]。如果只是选择一部分的个体分类器来生成集成分类器,那么这种集成学习策略就称为“选择性集成”[3]。选择性集成算法需要对个体分类器进行扰乱,按照扰乱手段的不同,可以将现有集成算法分成两大类:基于单模态扰乱的选择性集成算法(简称“单扰乱算法”)和基于多模态扰乱的选择性集成算法(简称“多扰乱算法”)。单扰乱算法只利用一种策略来将数据集打乱,以得到多个不同的个体分类器[4,5]。多扰乱算法则利用多种策略来将数据集打乱,以得到多个不同的个体分类器[6]。相对于单扰乱算法而言,多扰乱算法具有显著的优势,即更容易实现个体分类器的多样性。正是由于上述优势,多扰乱算法得到了广泛研究与应用[7,8]。
本文针对多扰乱算法进行研究,利用两种策略分别将数据集的样本与特征空间打乱,从而得到一种选择性集成算法SE_RSAR。该算法的大体思路如下:①通过随机的重复采样策略将数据集的样本空间打乱,产生多个采样集;②对任意一个采样集Sample,通过基于相对决策熵的属性约简策略先对Sample进行约简,然后利用约简后的采样集训练一个个体分类器;③从第②步所生成的所有个体分类器中,利用贪婪机制[9]挑选出若干个性能较好且差异性较大的个体分类器;……
登录APP查看全文
