基于Spark字典表压缩存储的关联规则算法优化
2021-08-12刘丽娜姜利群
计算机应用与软件 2021年8期
刘丽娜 姜利群
(广州工商学院计算机科学与工程系 广东 广州 510850)
0 引 言
数据挖掘的概念已提出多年,其宗旨在于从海量数据中分析出对现阶段或未来有意义的数据信息,它涉及的经典算法分类有频繁项集生成[1]、频繁模式增长[2]和垂直格式等[3-4]。其中频繁项集生成的关联规则(Apriori)算法尤为经典,用于挖掘数据元素之间的关系,如通过关联规则可以得出是吃米饭的家庭离婚率高还是吃面食的家庭离婚率高[5]。关联规则是在海量元素中找出元素之间的有趣关系。频繁模式增长的代表算法是FP-growth[6],其基本原理是将频繁项集规约至一棵模式树中并根据条件按需挖掘。垂直格式主要针对数据维数及属性较低的数据模型,以数据维数即列项作为行标,将事务项作为列标,从而达到压缩数据库的目的[7]。
面对数据大爆炸的信息时代,传统的数据处理速率已无法应对庞大的数据量,同时无法满足人们的需求,而Spark技术的出现弥补了该缺陷。Spark是在Hadoop的基础上进一步改进以适用于大数据分析,当数据集全部载入内存且条件满足的情况下其速度可比Hadoop快100倍之多[8]。但软件的更新有限,数据的增长无限,刘莉萍等[4]指出,在Spark的并行处理之路上内存及数据是未来两大研究突破点。
基于上述问题,本文在Spark的列式存储技术的基础上进行不断压缩剪枝,接近断层式地减少数据量加快并行处理速度,通过实验验证该算法适用于分析各种结构化数据集。
1 相关研究
Apriori最初由Agrawal等[9]提出,后续学者为不断提高运行速度对其进行了无数次改进。……
登录APP查看全文
