基于属性相关分析的离群数据并行挖掘算法
2011-08-01张继福
太原科技大学学报 2011年5期
关键词:数据挖掘
王 磊,张继福
(太原科技大学计算机科学与技术学院,太原030024)
离群数据(Outlier)就是明显偏离其他数据,不满足数据的一般模式或行为,与存在的其他数据不一致的数据[1]。离群数据挖掘问题可以看作两个子问题:(1)定义在给定的数据集合中什么样的数据认为是不一致的;(2)找到一个有效的方法挖掘这样的离群数据。离群数据挖掘作为数据挖掘的一种重要技术,在欺诈检测、网络安全分析、入侵检测等领域有广泛的应用[2]。
目前,国内外主要的离群数据挖掘算法大致可分为基于统计的方法[1]、基于距离的方法[3]、基于深度的方法[4]、基于密度的方法[5]和基于偏差的方法[6]等。随着数据规模的不断增大,高维海量离群挖掘是当前研究热点之一,其主要研究成果有:Aggarwal和Yu[7]于2005年提出的投影离群数据检测算法,Cui Zhu[8]等提出的基于用户实例的高维数据检测算法,张继福[9-10]等通过引入稠密度系数提出的基于概念格的离群数据挖掘算法,葛凌云[11]等提出的利用微粒群算法搜索稀疏子空间算法,Mohamed[12]等提出的基于属性相关分析的聚类算法。蔡江辉[13]等提出了一种基于聚类的离群挖掘算法。但是,这些方法都是在单机环境下运行的,随着信息技术的不断发展,大量的数据被存储在数据库中,且数据普遍具有分布稀疏、维度高、数据量呈指数增长等特点,这些因素都对计算机的单机计算能力提出了非常高的要求。与此同时,受限于大型机、巨型机的昂贵价格,使它们在实际……
登录APP查看全文
