基于半监督集成学习的自适应入侵检测研究
2021-09-23李斌张燕
电气自动化 2021年4期
李斌, 张燕
(1.商洛学院 商洛学院科技处,陕西 商洛 726000;2.商洛学院 数学与计算机应用学院,陕西 商洛 726000)
0 引 言
传统基于模式识别的入侵检测方法需要大量完备的训练数据集进行模型训练,才能使检测模型具有较高的检测准确率。而在实际的网络入侵检测中,网络入侵方法日新月异,收集完备的训练数据集几乎是不可能的,并且收集和标记数据的过程难度大、费用高,导致数据集有少量的有标签样本和大量的无标签样本,在此情况下,传统的监督学习算法无法取得较好的分类性能。由于这种情况在实际应用中普遍存在,如网络入侵检测[1]、软件检测[2-4]、医疗诊断[5]和文本检测[6]等等。
现有算法大多是面向均衡数据集,在均衡数据集下有较好的泛化性能,如文献[7]中的成对标记法,每次迭代对正负类样本各选择一个进行标记,这样就要求数据集是均衡的,即两类样本的数量相当,而在实际应用中,两类样本的数量是不相当的,例如在网络数据流中,存在大量的正常行为数据和极少量的入侵行为数据,而对入侵检测系统来说真正要关注的是对入侵行为的查准率和漏报率。因此本文结合半监督学习、bagging算法和online learning等算法思想,提出半监督集成学习,并将该算法应用到网络入侵检测中。
1 半监督集成学习算法
集成学习算法通过一定方法改变数据集的分布,获得多个训练数据集,进而获得多个基分类器,然后对多个集分类器按照一定的策略进行集成获得强分类器,实践和理论都证明,该方法有较好的泛化性能[8-9]。……
登录APP查看全文
