一种基于邻近性和团的异常数据检测算法∗
2021-06-29蔡江辉杨海峰荀亚玲
计算机与数字工程 2021年6期
解 峰 蔡江辉 杨海峰 荀亚玲
(太原科技大学计算机科学与技术学院 太原 030024)
1 引言
异常数据检测是数据挖掘的一个热门研究方向,其目标是寻找与多数对象明显不同的样本点。在数据的分布图中,这些样本点与其他数据点距离较远,所以也被称为离群点[1](outlier)。异常数据的检测方法按照类型分为基于模型的方法[2]、基于聚类[3]的方法、基于邻近[4]的方法。基于模型的方法需要建立一个异常点不能完美拟合的数据模型,通过考虑对象异常的可能概率,运用概率分布模型[5],计算样本分布的均值标准差,如果对象不能很好地同该模型拟合,则认为该对象为异常点。基于模型的异常检测方法对数据作统计学假定,只有当假定满足实际约束时,才能检测到异常数据。简单模型(如高斯模型)对参数进行拟合仅需要线性时间,但当模型复杂(如混合模型[6])时,需要多次迭代来拟合最佳参数。基于聚类的异常检测方法,假定正常数据属于相对密集的簇,而异常数据属于稀疏的簇或不属于任何簇,在这种假定下,通过考察对象与聚类算法产生的簇之间的关系来识别异常数据,当识别到不属于任何簇类的对象,或者属于偏远的且样本量较少的簇时,则大概率为异常点或异常簇。基于聚类的方法是一种无监督的检测方法,它不依赖于数据的标签,直接将对象与簇进行比较来检测异常点,但是对于大型数据集,聚类方法开销较大,不适用于异常检测。……
登录APP查看全文
