APP下载

基于分布式系统的关联规则挖掘算法

2011-06-21霍桂利

山西广播电视大学学报 2011年6期
关键词:关联规则数据库

□霍桂利

( 山西建筑职业技术学院,山西 太原 030006)

一、数据挖掘与数据库

数据库或数据仓库可能存储相当大数量的数据,在现在的大型数据库中,保存了大量的数据,数据库自然成为数据挖掘的数据基础。数据挖掘的发展方向是和数据仓库相结合。在这样的数据环境下进行关联规则的挖掘可能需要充足的处理器资源,分布式系统是一个可能的解决方案。同时许多大型数据库本来就是分布式的。数以万计的交易数据很可能存在不同的地点,这种事实使得研究数据库中挖掘关联规则的高效分布式算法显得非常重要,同时带动并行算法的研究。因为分布式算法具有高度的适应性、可伸缩性、低性能损耗和容易连接等特性,它将可以作为挖掘关联规则的理想平台。由于有大量事务数据库的存在,这些数据库中存储海量的数据,很容易想到将一个集中的数据库进行分割,从而利用分布式系统带来的高度的可伸缩性,达到提高效率的目的。D.W.Cheung揭示了分散数据集与集中数据集之间的一些有趣关系,并提出了一个快速的基于分布式系统的关联规则挖掘算法FDM,该算法通过生成数量较少的候选数据集,大大减少了在挖掘关联规则时需要处理的数据量。

以事务数据库作为讨论对象,而相应的方法可以很容易地扩展到关系数据库中,该数据库存储了大量的交易数据,每一个交易都有一个唯一的交易码(TID}和一组属性数据。此外,可以认为该数据库是“水平”分片的(例如,对交易进行分组),并且被分配在靠消息传递进行通信的分布式系统中。……

登录APP查看全文

猜你喜欢

关联规则数据库
撑竿跳规则的制定
“苦”的关联
数独的规则和演变
让规则不规则
数据库
智趣
TPP反腐败规则对我国的启示
数据库
数据库
数据库