APP下载

基于二阶分段式的Apriori算法优化

2021-07-21刘丽娜吴新玲

计算机工程与设计 2021年7期

刘丽娜,吴新玲,2

(1.广州工商学院 计算机科学与工程系,广东 广州 510850;2.广东技术师范大学 计算机科学学院,广东 广州 510665)

0 引 言

数据挖掘模型主要有分类模型、聚类模型、回归模型和频繁项集[1]。频繁项集的关联规则算法——Apriori算法由Rakesh Agrawal和Ramakrishnan Srikant提出[2],但后期随着研究的不断深入以及数据量及其复杂度的不断增加,仅限于两种属性值的数据集挖掘、过多的产生候选频繁项集和频繁遍历数据集导致内存溢出等弊端也日益突出。

Apriori算法的改进主要集中于减少I/O消耗和压缩数据量。文献[3]通过构建数据集矩阵压缩数据量提高算法执行效率,但对数据集原型的约束较高,且对多维度多属性值数据的挖掘模型并未说明。文献[4]Eclat算法利用数据量远大于数据集维度的特点提出了行与列的转置存储,压缩数据集,但该方法不适用于分析数据集较小或事务项小于数据集维度的数据。文献[5,6]利用Hadoop并行计算框架分散数据量,验证了并行计算的优势,但仅靠并行计算并不能让执行效率最大化。文献[7]提出了依托Spark计算框架的Apriori改进算法YAFIM,该算法利用哈希树判断候选频繁项集减少I/O消耗,但因其频繁调用算子且产生大量候选频繁项集使得算法效率提高有限。文献[8] 在文献[7]的基础上提出IABS算法,该算法结合文献[4]行与列的转置结构,然后再使用YAFIM算法生成规则,虽然IABS算法的执行效率较YAFIM算法有所提高,可扩展性也更强,但YAFIM算法原有的缺陷并未消除。文献[9,10]通过构建布尔数据集矩阵压缩数据量,同时加权减少内存和I/O,但未分析对加权后有效规则完整性的影响。……

登录APP查看全文