基于特征集聚和卷积神经网络的恶意PDF文档检测方法
2021-08-24俞远哲王金双
网络安全与数据管理 2021年8期
俞远哲,王金双,邹 霞
(陆军工程大学 指挥控制工程学院,江苏 南京210001)
0 引言
PDF(Portable Document Format)文档的使用非常广泛,但随着版本的更新换代,PDF文档包含的功能也变得多种多样,其中一些鲜为人知的功能(如文件嵌入、JavaScript代码执行、动态表单等)越来越多地被不法分子利用,来实施恶意网络攻击行为[1]。APT(Advanced Persistent Threat)攻击[2]常常借助恶意PDF文档这一媒介,通过社会工程学、水坑攻击、钓鱼攻击等手段,构造巧妙伪装的恶意文档,诱骗受害者下载,从而侵入或破坏计算机系统。相比传统的可执行恶意程序攻击,恶意文档攻击具有更强的迷惑性。
近年来,基于机器学习的恶意PDF文档检测技术被广泛使用。相比于传统签名匹配检测,它能够及时发现新型恶意文档且检测模型更新方便迅速。其中基于静态检测的机器学习方法,具有高效、成本低、解释性强等特点。而深度学习相较于机器学习算法,更强调学习数据中的隐藏信息,如特征的相关性。
前期研究利用传统的机器学习模型如SVM、随机森林等,对小规模的数据分类效果较好,但是当数据维度(包括特征维度及样本维度)过大时,需要耗费大量的资源进行学习。而卷积神经网络通过卷积核来实现高维数据的处理,提取局部特征;通过池化操作,来提取一块区域内的主要特征,能降低参数数量,减少冗余,防止模型的过拟合;最后通过全连接层,将局部特征根据权值整合成完整的特征。但是实际应用中,文档特征与图像特征不同,因为文档特征提取的顺序不同,不相邻的两类特征之间也存在一定的相关性,而卷积核提取的是局部相邻特征,损失了部分全局信息,降低了文档特征的表征能力。……
登录APP查看全文
