一种基于MapReduce的频繁项集挖掘算法
2015-04-30孙兵率
孙兵率
摘要摘要:随着大数据时代的到来,针对Apriori算法和FPGrowth算法在挖掘海量规模数据频繁项集时,存在内存不足、计算效率低等问题,提出一种Aggregating_FP算法。该算法结合MapReduce并行计算框架与FPGrowth算法,实现频繁项集的并行挖掘,对每个项进行规约合并处理,仅输出包含该项的前K个频繁项集,提高了海量数据决策价值的有效性。在Hadoop分布式计算平台上对多组规模不同的数据集进行测试。实验结果表明,该算法适合大规模数据的分析和处理,具有较好的可扩展性。
关键词关键词:频繁项集;MapReduce;Hadoop;可扩展性
DOIDOI:10.11907/rjdk.151007
中图分类号:TP312
文献标识码:A文章编号文章编号:16727800(2015)004007503
0引言
随着大数据时代的到来,数据库的容量越来越大,已经达到PB,甚至EP水平,传统的数据分析方法和技术不能完全满足数据处理需要。为能快速得到隐藏在海量数据背后的具有决策价值的知识,需要结合当前数据技术开拓新的数据挖掘方法。
MapReduce[1]是Google提出的利用集群来处理大规模数据集的并行计算框架,Hadoop[2]是Apache基金会开发的一个分布式系统架构,其开源实现了MapReduce。Hadoop通过组织一定规模集群,构建分布式平台对大规模数据进行计算和存储,已经成为目前主流的云计算技术平台。国内外诸多学者在Hadoop平台上基于MapReduce对数据挖掘算法进行了研究[35]。
频繁项集挖掘是关联规则分析的关键步骤,针对Apriori算法和FPGrowth算法在挖掘海量规模数据频繁项集时的性能瓶颈,本文提出一种Aggregating_FP算法,该算法运用了MapReduce并行计算框架与FPGrowth算法“分而治之”的思想。……
