Apriori算法的改进及在电子商务中的应用
2018-06-13袁晓建张岐山甘智平陈焕辉傅龙天
福州大学学报(自然科学版) 2018年3期
袁晓建, 张岐山, 甘智平, 陈焕辉, 傅龙天
(1. 福州外语外贸学院信息系, 福建 福州 350202; 2. 福州大学经济与管理学院, 福建 福州 350116; 3. 福州外语外贸学院教学发展中心, 福建 福州 350202)
0 引言
随着信息技术的发展和政府对电子商务领域的积极推动, 我国的电子商务正以前所未有的速度蓬勃发展, 并在经济发展中日渐凸显出带动作用. 但随着用户数量和产品数量的急剧增长, 以及用户需求的个性化、 多样化, 这对电子商务企业营销提出了更高的要求. 如何在存储的海量数据当中发现知识、 使用知识, 并结合实际情况向顾客推荐商品或者打折促销, 关联规则挖掘在现代营销中扮演着重要的角色.
关联规则挖掘是在数据中查找存在于项目集合中的频繁模式、 关联、 相关性及因果结构. Apriori算法是关联规则挖掘重要的方法, 它是Agrawal等[1]在1994年提出的.
1 关联规则和Apriori算法[2]
1.1 关联规则
关联规则提出的目的是为了寻找事务数据库中隐藏的不同项之间的联系, 在海量的数据库中找出频繁发生的项或子集, 以及项目之间的相互关联性. 其经典的应用就是大家熟知的“啤酒和尿布”案例. 它的原理可描述为:
设D是一个待挖掘分析的事务数据库,D中所有项目的项集为I={i1,i2, …,im}, 由此可知D中的每个事务都是I的一个子集. 并定义k项集为包含k个项目的集合. 记s(X)为项集X的支持度(sup), 其含义是事务数据库D中包含该项集的交易数据的条数. 设定最小支持度(minsup), 如果一个项集的支持度大于此最小支持度, 则称它是频繁的;……
登录APP查看全文