APP下载

基于集成学习算法的恶意软件感染二分类预测

2021-06-03张银杰揣锦华翟晓惠

计算机技术与发展 2021年5期
关键词:分类特征模型

张银杰,揣锦华,翟晓惠

(长安大学 信息工程学院,陕西 西安 710064)

0 引 言

集成学习算法是近些年来较为流行的基于树的机器学习方法[1],常用于数据挖掘领域的分类或回归预测任务[2-4]。在此背景下,该文选择kaggle平台的开源数据集,对计算机感染恶意软件这一主题进行二分类预测,以探究集成学习算法在网络安全相关的多维数据预测过程中的应用[5]。主要关注集成学习在特征选择与预测模型建立中的实际运用。对原始数据进行预处理,提出利用原有特征进行时间戳特征的构建使得原数据在时间上有序,也为数据集提供了时间维度的特征。

如何尽可能地展现出原数据集中的有效信息并建立二分类模型,实现对计算机是否感染恶意软件的预测目标是该文研究的主要内容。

1 数据认知与预处理

1.1 数据认知

文中数据来源于kaggle开源数据集,记录了千万台Windows计算机的信息,包括计算机所属地理区域、硬件、防卫软件、操作系统设置等多维信息,共计82个属性。预测标签为属性HasDetections,其包含两个数量相当的类别0和1,当其数值为1时表示感染恶意软件,为0时表示未感染恶意软件。为探究集成学习算法在本数据集上的分类预测作用,采用前200万条数据进行研究。

原始数据集存在大量属性字段,经过初步的数据探索性分析[6],发现属性字段不同值对预测标签的影响是不同的。例如图1为Census_OSInstallTypeName字段属性值HasDetections率的分布。该字段共包含九个类别值,每个类别值的数量如图中条形图所示,感染恶意软件的概率用折线图表示,可以看出类别之间的感染率存在着差异,部分安装类型下感染率明显超过了0.5均值,说明通过这些安装方式安装操作系统的计算机更容易感染恶意软件。……

登录APP查看全文

猜你喜欢

分类特征模型
一半模型
分类算一算
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
不忠诚的四个特征
教你一招:数的分类
3D打印中的模型分割与打包
线性代数的应用特征