基于属性熵和加权余弦相似度的离群算法
2014-06-13刘爱琴荀亚玲太原科技大学计算机学院太原030024
太原科技大学学报 2014年3期
关键词:数据挖掘
刘爱琴,荀亚玲 (太原科技大学计算机学院,太原 030024)
离群数据挖掘是数据挖掘领域中的一个重要分支,其目的是找出隐含在海量数据中的相对稀疏而孤立的异常数据模式。离群数据挖掘有着广泛的应用,例如网络非法入侵检测及天文学上新星体发现等[1]。
目前,很多数据的维数非常高,有的甚至高达上百维,如何提高高维数据离群挖掘的效率是目前研究的一个重点。在高维数据空间中,数据的稀疏性意味着每个点都可以看作离群数据,因此传统的基于统计的、基于分类的、基于距离以及基于聚类等方法的离群数据挖掘算法不再能有效发现离群数据[2]。当前用于高维离群检测的方法有基于信息理论的、基于余弦相似度、基于子空间的、基于基尼指标的、基于属性相关性分析等算法。基于信息理论的离群挖掘算法通过分析数据集的信息熵来进行离群挖掘,此类算法基于这样的假设:离群点增加了数据集的不规则性。典型的算法有基于信息熵的快速贪婪算法[3]和信息熵度量的离群数据挖掘算法[4]和基于信息熵的相对离群点的检测方法等[5]。ANNA K使用余弦相似度来度量高维数据中的离群对象,也是一种比较有效的方法[6]。所谓子空间技术是针对全空间而言的。在数据的所有属性中,选取若干维属性所组成的数据空间为子空间。离群挖掘即找到容易识别离群点的子空间,子空间技术对高维数据效率很高。AGARWAL C等提出一种基于……
登录APP查看全文
