基于支持向量机的蠕虫检测技术
2012-10-17陈霜霜
陈霜霜
江苏省盐城师范学院信息科学与技术学院 江苏 224002
0 前言
支持向量机(Support Vector Machine,SVM)是一种建立在统计学习理论基础之上的机器学习方法,根据 Vapnik结构风险最小化原则,将支持向量机问题归结为一个二次型方程求解问题,通过构造最优超平面,使不同类样本集与最优分类面之间的距离最大,以获得最好的泛化能力。此外,由于支持向量算法是一个凸优化问题,所以局部最优解一定是全局最优解,这是其他学习算法所不及的。蠕虫检测可看成是一个二类分类问题,支持向量机是一种典型的两类分类器,所以可将支持向量机用于蠕虫检测。假定大小k的训练样本集T={(x1,y1),(x2,y2)…(xk,yk)},(k∈ N),由两个类别组成,正常类及感染蠕虫类。如果向量xi属于正常类,则标记为正(yi=1),如果向量xi属于感染蠕虫类,则标记为负(yi=-1)。
1 核函数的选取
支持向量机的性能受核函数的影响比较大。核函数的选取以及核函数中参数的确定在不同的问题领域是不一样的,目前的做法一般都是根据经验选取。和常见的多项式核、Sigmoid函数相比,径向基函数RBF 核函数具有参数数量少、数值限制条件少等优点,所以本文选用径向基函数 k(x,y)=exp(-‖x-y‖2/ρ2)为核函数。对于参数 的选择有这样一个经验公式ρ=1/E(‖x-y‖2),x, y分别代表不同的训练样本 。
2 支持向量机方法实现蠕虫检测的基本思想
2.1 蠕虫检测指标的选取
尽管目前已提出各种蠕虫检测技术,但是如果蠕虫检测指标选取不好,将很难保证检测技术的有效性。由于蠕虫的目标是尽可能地传播,故蠕虫扫描时将发起大量具有随机目标地址的“第一次连接”(FCC,First Contact Connection)由于目标地址的随机性,因此“第一次连接”的失败概率很高;……
