基于多视图的半监督集成学习方法*
2021-02-25张振良刘君强
计算机与数字工程 2021年1期
张振良 刘君强 黄 亮 张 曦
(1.鄂尔多斯应用技术学院 鄂尔多斯 017000)(2.南京航空航天大学民航学院 南京 211100)
1 引言
在机器学习和数据挖掘应用程序中,我们寻找很多方法来提高分类器的性能。集成学习是一种机器学习方法,最初,集成学习的提出是由于Schapire 证明了多个弱分类器可以形成一个强分类器,所谓的弱分类器是指分类效果很差的模型,集成学习的目的是通过组合多个分类器的输出来构造多个不同的分类器[1]。所谓“集成”是专家的混合体,用以防止过度拟合以及减少所有基础学习器的误差,而如何结合多种学习器的输出结果和提高基分类器的多样性来提高分类器的精度是重点[2]。
集成分类器的关键是根据所有基分类器的预测来量化未标记样本的置信度,而精度也随分类器的数量增加而增加,而且对所有的训练集以及算法没有要求,避免了大量交叉验证[3]。
现有的算法大多只使用标记数据来构造分类器,而且在很多情况下,标记数据的数量通常不足以训练出鲁棒性很强的分类器,同时大多数情况下,标签数据的获取成本很高,而未标记的数据则很容易获得而且数量更多。基于这个原因,半监督学习获得了越来越多的关注,它致力于从未标记样本中获得信息,寻找大量的未标记数据中的规律,再利用少部分已标记数据的信息,做出预测。大多数现有的SSL(Semi-supervised learning)技术主要是在未标记数据的信息获取方式上加以区别。
将半监……
登录APP查看全文
