基于FP_Growth算法的关联规则挖掘研究及应用
2021-03-06马瑞敏吴海霞
太原师范学院学报(自然科学版) 2021年1期
马瑞敏,吴海霞
(长治学院 计算机系,山西 长治 046011)
0 引言
随着计算机技术、移动互联网与物联网的高速发展,可供人们采集利用的数据越来越多,呈现爆炸式增长.大量的数据背后隐藏着许多重要的信息,如何对其进行更高层次的分析,并转换成有用的信息和知识,成为数据挖掘技术研究的主要内容.关联规则挖掘是数据挖掘的一个重要分支,其概念最早由美国科学家R.Agrawal等人于1993年提出,最初用于挖掘顾客交易数据库中用户购买的商品之间内在的隐含关系及关联规则,从而为决策者提供决策支持.现在关联规则挖掘不但在商业分析中得到了广泛的应用,在通信、金融、交通、健康医疗和Web用户行为分析等领域也得到了广泛应用.
1 关联规则及其抽象描述
关联规则挖掘主要用于发现存在于数据库中的项或属性间的关联关系.设I={I1,I2,…,Im}是项的集合,其中m表示项的数目.对于项集A,若A中含有的项数为k(k≤m),则称A为k-项集[1].D为数据库事务的集合,用|D|表示事务集中事务的个数.对于每个事务T有T={t1,t2,…,tm},ti∈I,T≠∅.关联规则是形如A⟹B的蕴涵式,其中A⊂I,B⊂I,A≠∅,B≠∅,并且A∩B=∅.表示事务T在含有项集A的条件下,同时含有B的概率[2].用户关心的关联规则,可以用两个标准来衡量:支持度和可信度.
1.1 支持度
支持度的意义在于度量项集在整个事务集中的重要性.我们在发现规则时,总希望找到高概率出现的项集.单一项集的支持度表示该项集在事务集中出现的概率.即,
support(A)=P(A)=count(A)/|D|.
规则A⟹B的支持度,表示项集{A,B}在事务集……
登录APP查看全文
