基于模糊孤立森林算法的多维数据异常检测方法*
2020-06-18汪旭祥
计算机与数字工程 2020年4期
李 倩 韩 斌 汪旭祥
(江苏科技大学 镇江 212000)
1 引言
所谓异常,即为一种具有不同数据特征的数据模式,该模式有别于正常情况,基于这种异常情况的研究与分析就称之为异常检测技术[1~4]。近年来,国内外研究学者不断研究探索提出了许多异常检测的算法,主要包括基于统计的模型,基于距离的模型,基于线性变换的模型,基于非线性变换的模型等。丁洁等[5]提出了一种基于相关系数的异常行为检测方法,该方法借助于自相关系数,研究并实现了基于自相关模型的异常行为自动检测系统,拥有较强的扩展性。文献[6]结合基于成分分裂的增量学习方法,采用局部贝叶斯模型选择方法进行高斯混合模型训练。提出了一种基于高斯混合模型的异常检测算法(LVBGMMS),该算法针对EM算法以及贝叶斯模型选择方法的弊端进行改进。李海林等[7]提出一种基于频繁模式发现的异常检测方法,利用符号化的时间序列找出原有序列中的频繁模式,最后根据最长公共子序列匹配方法度量频繁模式与当前新增加时间序列数据之间的相似度,找出新增数据的异常模式,解决了传统异常片段检测方法在处理增量式时间序列时效率低下的问题。然而上述的这些方法大都基于正常模型,是针对正常数据的一种优化方法,因此,存在一定的误报情况,即将正常数据识别为异常数据或不能全部识别出异常数据。
孤立森林算法由文献[8]首次提出,该算法是由大量的树组成,这里称作iTree,最后的结果则是综合各个iTree的结果。……
登录APP查看全文
