一种新的MDP算法的研究*
2012-11-24高集荣杨永红党运峰
网络安全与数据管理 2012年5期
高集荣,田 艳,杨永红,党运峰
(中山大学 信息科学与技术学院,广东 广州 510006)
关联规则挖掘[1]是数据挖掘的一个重要组成部分,最早由AGRAWAL R在1993年提出关联规则的问题,经过多年的发展,形成了很多有效关联规则挖掘算法,如Apriori算法、FP-growth算法等。范明[1]等人提出用改进的Apriori算法来挖掘数据立方体的关联规则,高学东[2]等人提出的Apriori_Cube算法也是通过改造Apriori算法进而在数据立方体中挖掘多维关联规则。但传统的关联规则挖掘算法依然存在一些问题:(1)主要集中在事务数据库的应用上,而目前广泛用于数据分析的是关系数据库和数据仓库,与事务数据库在结构和处理方法上有很大的差异;(2)集中在布尔型的事务项集的基础上,对关系数据库和数据仓库的多维数据,其处理方式不适合;(3)目前基于关系数据库和数据仓库的多维关联规则挖掘算法虽然大多都是有效的,但当数据量比较大时,这些算法的性能不太好。针对以上问题,本文在分析了关联规则的性能瓶颈和多维关联规则的基本特征后,提出了一种高效的多维关联规则算法。
1 算法描述
1.1 MDP算法的基本思想
多维关联规则是指从关系数据库或者数据仓库中的有趣关联规则。多维关联规则的基本概念最早是由KAMBER M.等人在1997年提出的,关联规则的支持度和置信度通过数据立方体的COUNT值来计算。同时他们还提出了基于元规则的多维关联规则算法multi-D-slicing算法和n-D cube search算法。随后不少学者在多维关联规则研究做出了不少努力,提出的多维关联规则算法大多是基于Apriori算法的改进算法[3-5]。……
登录APP查看全文
