APP下载

基于缓冲区技术的增量数据关联规则挖掘算法

2020-07-13刘雯婷

关键词:关联规则数据库

刘雯婷,周 军

基于缓冲区技术的增量数据关联规则挖掘算法

刘雯婷,周 军

(辽宁工业大学 电子与信息工程学院,辽宁 锦州 121001)

利用传统的FP-tree算法对增量数据进行挖掘,需要多次建树,效率较低。CAN-tree算法虽避免了多次建树,但当数据增量改变时,需多次更新树,并且伴随有数据丢失的现象发生。针对以上问题,提出了一种基于缓冲区技术的增量数据关联规则挖掘算法,算法利用缓冲区技术避免数据丢失的情况发生,有效提高关联规则的挖掘效率,实验结果表明算法是有效的。

增量数据;关联规则;缓冲区

随着互联网的飞速发展,大数据和云计算已成为学术界的热点研究对象。伴随信息时代的不断发展,各行业积累了海量数据,人们希望通能够过技术的进步来有效存储并挖掘这些数据,关联规则技术是数据挖掘中的重要部分,主要用于发现事务数据库中项与项间的隐藏联系。目前大多数的增量数据关联规则挖掘算法都是在Apriori算法[1]以及FP-Growth算法[2]上进行改进所得到的。牛海玲等[3]将Apriori算法进行并行处理,引入矩阵从而有效减少扫描数据库的次数,利用局部和全局剪枝方法来减小候选项集数目。易彤等[4]在FP-tree的基础上引入支持度函数概念,避免大量候选项集的生成。程广等[5]将FP-Growth算法与MapReduce方法相结合,提高关联规则挖掘效率。但上述这些改进算法仍存在诸多问题,需要多次扫描数据库,当数据量改变时需重新建树,在挖掘过程中,因为要保存项集信息,需多次递归生成条件FP-tree,浪费大量时间和空间。……

登录APP查看全文

猜你喜欢

关联规则数据库
撑竿跳规则的制定
“苦”的关联
数独的规则和演变
让规则不规则
数据库
智趣
TPP反腐败规则对我国的启示
数据库
数据库
数据库