基于Apriori的改进算法
2012-10-18陈静
陈 静
(盐都广播电视大学,江苏 盐城 224006)
基于Apriori的改进算法
陈 静
(盐都广播电视大学,江苏 盐城 224006)
关联规则的提取是数据挖掘中的重要研究内容,对关联规则提取中的Apriori算法进行了分析与研究,针对该算法的运算效率不高,对该算法进行了改进,提出了Apriori改进算法。Apriori改进算法采用二进制数据垂直表示方法,只用扫描事务数据库一次得到一阶大项集的二进制数据垂直表示。K阶候选项集的操作只要基于这个一阶大项集,而不需重复扫描数据库,从而提高了挖掘算法的效率。
数据挖掘;关联规则;Apriori算法;Apriori改进算法
数据挖掘(Date Mining),通常也称为数据库中的知识发现(KDD),精确地说,在KDD中进行知识学习的阶段称为数据挖掘。数据挖掘是KDD中的一个非常重要的处理步骤,但人们通常不加区别地使用这两个术语。数据挖掘是一个多学科交叉研究领域,它融合了数据库、人工智能、机器学习、统计学、知识工程、面向对象方法、信息检索、高性能计算以及数据可视化等最新技术的研究成果[1]。
1 关联规则分析
关联规则展示属性-值频繁地在给定数据集中一起出现的条件。关联规则可描述为:设集合I={i1,i2,…,ik}是k个不同项目组成的集合。给定一个事务数据库D,其中的每个事务T是I中一组项目的集合,即TÍI,T有唯一的标识TID.若项集X Ì
I,且X Ì T,则事务集T包含项集X。一条关联规则就是形如X=>Y的蕴涵式,其中X Ì I,YÌ I,并且X∩Y= Æ。关联规则X=>Y成立的条件是:(1)它具有支持度Supp,即事务数据库D中至少有Supp%的事务包含X∪Y;它具有置信度Conf,即事务数据库D中包含X的事务至少有Conf%同时也包含Y[5]。……
