基于随机子空间的扩展隔离林算法
2021-07-02龙超奇
谢 雨,蒋 瑜,龙超奇
(成都信息工程大学软件工程学院,成都 610225)
(∗通信作者电子邮箱jiangyu@cuit.edu.cn)
0 引言
大数据时代的到来,使得海量的数据被收集和存储在数据库中,从体量巨大的数据中挖掘可理解的知识显得更加有意义。作为数据挖掘工作中重要的一环,异常检测算法正在蓬勃发展[1]。越来越多的异常点检测算法正在进一步被运用于日常生活的方方面面[2]。
近年来,国内外学者研究提出了多种异常检测算法。文献[3]中对这些算法进行了分类总结。按照异常识别技术分为:以基于角度的离群值检测(Angle-Based Outlier Detection,ABOD)算法[4]与基于连接函数的异常检测(COPula-based Outlier Detection,COPOD)算法[5]为代表的基于统计的方法;以K最近邻(K-Nearest Neighbor,KNN)分类算法[6]为代表的基于距离的方法;以局部异常因子(Local Outlier Factor,LOF)算法[7]为代表的基于密度的方法;以及以自编码器(Autoencoder)[8]为代表的基于学习的方法等。除此之外,基于集成的方法同样也在不断地被研究,其中具有代表性的技术包括:Bagging[9]与Boosting[10]抽样等。文献[11]中提出了一种基于隔离思想[12]的集成学习算法[1]:孤立森林(isolation Forest,iForest)算法,该算法首先构建了一个由多棵孤立树组成的孤立森林,随后将待检测数据点在孤立森林中进行遍历,记录该数据点被完全隔离的平均路径长度并生成对应的异常分数。文献[13]中指出由于iForest 算法的核心思想为隔离,且每棵孤立树通过随机选择的特征值来进行隔离,所以该算法具有计算速度快、准确度高与内存占用低等优点。
传统方法在各个领域内被广泛应用,可以通过不同方法的结合产生性能更优的异常检测模型。……
