AdaBoost的多样性分析及改进
2018-05-21王玲娣
王玲娣,徐 华
(江南大学 物联网工程学院,江苏 无锡 214122)
0 引言
集成学习是当前机器学习的热点研究方向之一,和传统单个分类器的构造目的不同,它并非力求得到单一最优分类器,而是按照一定策略集成一组个体分类器。在两种经典的集成算法:Boosting[1]和Bagging[2]被提出之后,研究者又陆续提出了大量的集成学习算法。其中Boosting算法可将粗糙的、不太正确的、简单的初级预测方法,按照一定的规则构造出一个复杂的,精确度很高的预测方法,但是很难运用于实际中;AdaBoost[3]的出现有效地解决了这一问题,因此AdaBoost成为了Boosting家族的代表算法,受到极大的关注,成功应用于声音文件检索[4]、人脸识别[5]、癌症诊断[6]及目标检测[7-8]等实际问题中。
集成学习主要有两个阶段:一是基分类器的生成;二是组合策略的选择。将相同的基分类器进行集成是无意义的,因为组合而成的分类器与基分类器的分类结果必然相同。所以基分类器之间要存在差异,即分类器多样性。Krogh等[9]证明,集成的泛化误差是由个体分类器的平均泛化误差和平均差异度决定的。虽然目前已存在多种多样性度量方式,但是关于它的严格定义并不统一[10-11],只是可以从大量研究资料中获知,多样性有益于集成方法的设计,如:2012年,文献[12]使用遗传算法组合不同的多样性用于选择性集成;而文献[13]于2014年通过向量空间模型形象地论证了多样性的有效性;2015年文献[14]明确提到多样性是集成学习成功的重要条件;文献[15]在2016年研究了很可能接近正确的(Probably Approximately Correct, PAC)学习框架下多样性对基于投票组合策略的集成方法泛化能力的影响。……
