基于Spark的关联规则挖掘算法并行化研究
2019-03-21许德心李玲娟
计算机技术与发展 2019年3期
许德心,李玲娟
(南京邮电大学 计算机学院,江苏 南京 210023)
0 引 言
随着信息技术的迅猛发展,数据量急剧增加。如何从海量的随机数据中挖掘出有价值的信息,已成为一个必须面对的课题,数据挖掘技术由此诞生。数据挖掘是从大量的、不完全的、有噪声、模糊的、随机的实际应用数据中,提取隐含在其中的、人们事先不知道但又潜在有用的信息和知识的过程[1-2]。而关联规则挖掘则是数据挖掘中一个非常重要的研究课题。关联规则挖掘的主要任务分为两项:从大量数据中找到频繁项集,根据频繁项集提取有价值的强关联规则。其中Apriori算法是其典型代表。该算法简单准确,但是面对急速增长的数据量,该算法对强关联规则的提取效率有待提高[3-5]。
Spark作为新一代的大数据运算框架,将数据载入内存,之后的迭代计算可以直接使用内存中的中间结果作运算,避免了从磁盘中频繁读取数据,拥有更高的执行效率,很适合运行迭代运算较多的数据挖掘与机器学习算法。基于此,文中研究了Apriori算法在Spark平台上的并行化方案,以提高算法提取强关联规则的准确性与实效性,并设计了实验对该方案的使用效果进行了检验。
1 Apriori算法原理
关联规则一般描述:项集→项集,如X→Y。
支持度(support):表示X,Y同时出现的概率。关联规则X→Y的支持度可表示为:
(1)
置信度(confidence):表示在X出现的情况下Y也出现的概率。
(2)
其中,δ(X)=|ti|X⊆ti,ti∈T|,是项集X出现的次数,ti表示某个事务的标识TID,T表示事务的集合。
频繁项集:是支持度大于最小支持度阈值的项集。……
登录APP查看全文
