基于一维卷积神经网络的恶意代码家族多分类方法研究
2021-12-14玄佳兴韩雨桐廖会敏魏博垚
王 栋 杨 珂* 玄佳兴 韩雨桐 廖会敏 魏博垚
1(国网电子商务有限公司(国网雄安金融科技集团有限公司) 北京 100053)2(国家电网有限公司电力金融与电子商务实验室 北京 100053)3(中国科学院信息工程研究所 北京 100093)4(首都师范大学信息工程学院 北京 100048)
0 引 言
恶意代码家族分类研究可理解为不同的恶意代码是否源自同一套恶意代码或是否由同一个作者、团队编写,是否具有内在关联性、相似性。而以深度学习为代表的人工智能技术则被认为能够在恶意代码分析方面发挥重要作用。
Yuan等[1]利用受限玻尔兹曼机(Restricted Boltzmann Machine,RBM)对多层感知机预训练,对安卓恶意软件的检测准确率从79.5%提升至96.5%。李盟等[2]使用n-gram频次信息以及各API间的依赖关系,提出一种提取恶意代码语义动态特征的方法。Jung等[3]结合了多层感知机与循环神经网络(Recurrent Neural Network,RNN)对恶意flash进行检测,以文件头(Headers)、标签(Tags)、指令操作码(Opcodes)、API调用序列为特征,达到98.33%的检测准确率。Pascanu等[4]将系统事件序列视为文本序列,使用循环神经网络和回声网络(Erasmus Student Network,ESN)进行降维,使用最大池化配合逻辑回归分类的方法,检测准确率比3-gram方法更好,提高到98.3%。Saxe等[5]在40万恶意样本数据集上训练一个四层感知机二分类模型,达到95%分类检出率、0.1%误报率。David等[6]以样本沙箱分析报告为特征,分解报告到单词级别后,将20 000维的输入向量降维嵌入至30维,使用k-近邻(k-Nearest Neighbor,kNN)分类,准确率从95.3%提升至98.6%。乔延臣等[7]对恶意样本汇编代码进行文本词向量分析,并将分析特征结果转化为图像送入CNN进行分类,实现了98.56%的分类准确率。……
