基于基分类器系数和多样性的改进AdaBoost算法
2021-09-09朱亮,徐华,崔鑫
计算机应用 2021年8期
关键词:分类
朱 亮,徐 华,崔 鑫
(江南大学人工智能与计算机学院,江苏无锡 214122)
0 引言
集成学习是机器学习研究领域的重要分支,它并非力求得到单一最优分类器,而是按照一定策略集成一组个体分类器。就像小组会中的投票表决一样,需要考虑每个人的意见,以提高决断的正确性。而Boosting[1]就是集成学习中的代表算法,它可将简单的、粗糙的、略比随机猜测好点的分类器,通过一定规则构造出一个复杂且精度高的强分类器[2],随着Freund等[3-4]对Boosting的研究改进,它成为最流行的分类算法之一[5-6],但是很难运用于实际中。自从1999年Schapire等[7]提出AdaBoost后,才真正将集成学习运用于实际问题。很多学者从统计学和间隔理论的方向,对AdaBoost的成功进行了解释[8-9]。由于AdaBoost的优秀表现,它被广泛应用于机体运动估计[10]、轴承的故障诊断[11]、交通风险预测[12]、医学诊断[13]、电力系统[14]、声呐图像[15]等现实问题中。
集成学习面临的问题主要在于两个方面:一是基分类器的选取;二是基分类器的组合。集成的泛化误差[16]由基分类器的平均泛化误差和平均多样性决定,文献[17]提供了更一般的整体泛化误差的表现形式,以及方差、协方差、偏差、噪声方差对泛化误差的影响。现在存在一个被广泛接受的观点是选出的基分类器既要精确也要多样,但关于多样性度量对于集成学习的影响没有学者给出严格的证明[18],也就是说,多样性有助于集成算法的设计。如文献[19]利用多样性提出了基于联结树的多元信息多样性近似估计方法,解决了高阶信息及高阶分布难以估计的问题。……
登录APP查看全文
