基于博弈论准确性和差异性兼优的选择性集成建模方法及其应用
2021-01-18陈双叶高建琛符寒光
陈双叶,高建琛,符寒光,赵 荣
(1.北京工业大学信息学部,北京 100124; 2.北京工业大学材料学院,北京 100124)
工业过程对象受原料属性、产品质量和产量及环境气候等因素的影响而具有动态特性,这些动态变化通常包括传感器漂移和过程漂移,在机器学习领域将其统称为概念漂移[1].因此,为了应对概念漂移,许多应用于软测量模型的自适应方法被提出,比如递归模型(recursive model, RM)(包含递归主成分回归(recursive principle component regression, RPCR)[2]和递归最小二乘法(recursive partial least squares, RPLS)[3]等)、滑动窗模型(sliding window, SW)[4]和即时学习模型(just-in-time learning, JITL)[5].然而,这些方法是在单模型上实施的,这使得模型在应对概念漂移时性能不稳定.
研究表明,集成学习算法具有较好的概念漂移处理能力.集成学习是一种通过结合多个子模型以提高整体泛化性能的算法.通常情况,建立集成模型涉及2个步骤:构建集成子模型池和组合子模型得到预测输出.在构建集成子模型池方面,周志华[6]提出子模型的差异性越大、准确性越高,则集成的效果越好; 其中最具代表性的集成算法为Bagging[7].但是如果将所有子模型都组合到集成模型中,那其中性能较差子模型会影响到集成模型的预测准确性,而且其中相似的子模型对集成的运算效率也有较大影响,因此越来越多的选择性集成方法被提出用于克服上述问题.Lin等[8]将K-means聚类、动态选择和顺序搜索方法相结合来选择子模型;遗传算法或其他优化算法也常用于选择集成的最优子集[9-10],但优化算法自身的计算开销较大;文献[11]提出利用子模型的在线预测性能排序进行动态选择.另外,选择性集成算法大多应用于解决分类问题,对回归问题的研究较少.在子模型输出组合方面,均值输出是一种简单但有效的方法;……
