基于同步频繁树的时间序列关联规则分析
2021-08-09李海林龙芳菊
李海林,龙芳菊
(1. 华侨大学 信息管理系,福建 泉州 362021; 2. 华侨大学 现代应用统计与大数据研究中心,福建 厦门 361021)
时间序列数据是指一系列时间及其对应属性值组成的序列集合,常见于医学、金融、水文等领域[1]。通过分析这些数据,如疾病[2]、股票[3-4]和水文数据[5]等,研究者可以发现相关问题的潜在信息,进而为相关部门或企业的工作提供指导性建议。关联规则是由Agrawal等[6]首次提出的,先找出频繁项集,再通过项集的支持度和置信度等指标,分析被研究对象间的关联关系。例如,购物篮分析案例就是关联规则的一个经典应用。Apriori算法是由Agrawal等[7]提出的,在挖掘频繁项集的过程中,该算法不仅要多次扫描数据库,还会产生大量的候选频繁项集,因而导致算法的挖掘效率低。为解决这一问题,很多学者从不同角度提出相应的方法。魏玲等[8]借鉴文献[9]的MapReduce框架,提出了基于MapReduce的Apriori改进算法(MapReduce算法),算法的基本思想是将频繁K−1项集的前K−2项作为键,将最后一项作为值,并将具有相同键的频繁K−1项集合并,以实现快速挖掘出候选频繁K项集。此外,他们还提出性能更高的基于Bigtable与MapReduce的Apriori改进算法(BM_Apriori算法),算法以事务集序号记录每个项出现的位置,通过求频繁K−1项集间的序号列表交集,即可快速获取候选频繁K项集。Zhang[10]基于概率论知识,通过参数a和b估算数据项集同时出现的概率,进而确定频繁项集,最终实现对Apriori算法的改进,但是该算法存在频繁项集缺失的可能性。Tran等[11]为了减少Apriori算法扫描数据库的次数,将事务集转化成事务矩阵,但是在矩阵运算过程中需要消耗较长时间。……
