基于散度的网络流概念漂移分类方法
2021-01-05钱德鑫郭建伟史海滨赵玉宇
计算机研究与发展 2020年12期
程 光 钱德鑫 郭建伟 史海滨 吴 桦 赵玉宇
1(东南大学网络空间安全学院 南京 211189)
2(教育部计算机网络和信息集成重点实验室(东南大学) 南京 211189)
3(江苏省计算机网络技术重点实验室(东南大学) 南京 211189)
4(华为技术有限公司西安研究所 西安 710075)
随着互联网的飞速发展,网络新应用、新协议层出不穷,网络应用程序越来越复杂;同时网络中的加密流量比例随着人们对于隐私的重视而不断扩大.这些问题使得传统的流量分类方法面临巨大的挑战,逐渐从基于端口和深度包检测技术(deep packet inspection, DPI)[1]的流量分类方法转向基于机器学习[2-3]的流量分类方法.基于机器学习的流量分类比较依赖于训练样本的环境.由于网络流量具有高度动态变化性、突发性、不可逆性等特点,因此流量的统计特征和分布会发生动态变化,导致基于流特征的机器学习方法产生概念漂移问题[4-5].网络流量概念漂移问题使得建立在原始数据集上的分类模型在新样本上适用性变差,造成分类器分类精度下降.
针对概念漂移问题国内外学者进行了大量的研究,并取得众多成果.然而这些方法还存在一些不足:1)当前大多数解决概念漂移的方法都是基于分类错误率[6]来检测概念漂移,带来的问题是获取样本标签需要耗费大量时间和资源,同时基于分类错误率的检测方法无法应对类不平衡[7]的网络流.2)当检测到概念漂移时,若只在新流量上训练分类器会导致历史知识的丢失[8],若将不……
登录APP查看全文
