基于聚类和实例硬度的入侵检测过采样方法
2021-07-02孙国梓
王 垚,孙国梓
(南京邮电大学计算机学院,南京 210023)
(∗通信作者电子邮箱sun@njupt.edu.cn)
0 引言
网络安全已经成为计算机系统以及计算机网络中的热点问题,引起越来越多的关注。一些常见的网络攻击类型,诸如分布式拒绝服务(Distributed Denial of Service,DDoS)攻击、僵尸网络(Botnet)等,一旦攻击得手将造成严重后果,例如2019年10月22日,亚马逊公司服务器遭DDoS攻击,攻击者试图通过垃圾网络流量堵塞系统,导致服务无法访问,攻击持续整整15个小时,造成的损失难以估量。
作为保证网络安全的重要技术之一,入侵检测系统(Intrusion Detection System,IDS)是网络安全防护方案的重要组成之一[1]。入侵检测系统是从计算机和网络中收集与分析流量信息,判断网络中是否出现一些异常行为。现代入侵检测系统呈现机器学习、深度学习等技术的高度融合的趋势,有效提高了网络攻击的检测效率。
基于机器学习的入侵检测模型已取得较好的性能,但数据不平衡仍是影响大多数入侵检测模型性能提升的瓶颈[2]。类不平衡会导致训练模型过拟合,在机器学习领域中,为解决不平衡问题,常采用合成少数类过采样技术(Synthetic Minority Oversampling TEchnique,SMOTE)[3]等采样方法平衡数据。但在入侵检测中,数据集往往更复杂、规模更大,不平衡程度更严重。传统的采样方法进行采样后会导致数据重叠,降低检测率。一些研究人员指出,不平衡问题是数据科学面临的十大挑战之一[4],同时数据不平衡问题也是机器学习中的研究热点之一。在入侵检测数据中往往攻击类型数据相对较少,正常流量的数量则相对偏多,但攻击类型数据往往包含关键检测信息,而在不平衡的入侵检测数据上训练机器学习模型,会导致模型偏向于拟合正常流量数据,泛化能力弱。……
