基于矩阵的Apriori的改进算法探讨数据挖掘中关联规则的研究
2013-08-21李燕珊
计算机光盘软件与应用 2013年12期
摘 要:文章建立在Apriori改进算法的基础之上,以深州市食品安全问题为研究对象,通过数据挖掘关联规则的方式,证实了食品质量与食品规格,食品产地,食品种类之间的相关性关系,望引起各方关注与重视。
关键词:Apriori算法;数据挖掘;关联规则;食品安全
中图分类号:TP311.13
食品质量与安全是一个专业性很强的问题,其标准的制定和抽样检测及评价都需要科学有效的方法。本文即结合实际数据,在改进Apriori算法下,对该问题进行详细分析与说明。
1 基于矩阵的Apriori改进算法分析
改进的基本思路在于:由于在常规意义上,Apriori算法建立模型过程中需要多次扫描事务数据库,耗费时间过多,当数据量庞大的时候运算效率低,于是裁剪数据集以减少I/O开支显得尤为重要。而FP-Tree通过合并一些重复路径,实现了数据的压缩,从而使得将频繁项集加载到内存中成为可能。
常规Apriori算法得以实现的关键在于:对事物数据库进行多次扫描,在扫描过程当中,计算得出事物数据库当中所包含的每个项目出现的次数,并生成候选1﹣项目集合,删除支持度在预期数值以下的项集,最终得出频繁1﹣项的基本集合。此过程中,往往需要对事物数据库进行多次,且重复性的扫描,因而运算效率较低,值得改进。
本文所提出的改进方法主要在于:将整个事物数据库压缩为一个频繁模式树的形式,借助于频繁模式树,生成相应的关联规则。先设定数据挖掘中最小支持度的阈值,在对事物数据库进行一次完整扫描的基础之上,生成对应的1﹣频繁集,按照由大至小的方式进行排列,并将支持度计数数值小于设定数值的方式集合项予以排除,生成结果集合L。……
登录APP查看全文