粒子群优化算法在关联规则挖掘中的研究综述
2021-05-14钟倩漪伏云发
钟倩漪,钱 谦,伏云发,冯 勇
昆明理工大学信息工程与自动化学院云南省计算机技术应用重点实验室,昆明650500
数据挖掘(database mining,DM)又称数据库中的知识发现(knowledge discovery in database,KDD),是从大量数据中提取出可信、新颖、有效并能被人理解的模式的高级处理过程[1]。关联规则挖掘(association rule mining,ARM)是一种寻找数据库中的频繁项或属性集之间相关性和因果关联的数据挖掘方法[2],由Agrawal 等人[3]于1993 年针对购物篮问题首次提出,主要用于发现数据之间隐藏的关联关系。目前,关于关联规则挖掘的相关研究较为成熟,一般使用精确算法或智能算法对之进行求解,如Apriori 算法[3]、FP-growth(frequent pattern growth)算法[4]、Eclat算法[5]等都是典型的精确算法。精确算法首先从事务集合中找出频繁项集,然后从频繁项集中挖掘出强关联规则,但在处理大量数据候选项集和复杂数据时会带来严重的时间、存储开销[6],且大部分算法需要人为设置支持度和置信度的阈值,导致结果易产生冗余规则及忽略重要规则。因此,部分学者转而研究智能算法在关联规则挖掘中的应用。Minaei-Bidgoli等人[7]提出了一种基于粗糙模式的多目标遗传算法进行数值关联规则挖掘,该方法使用由上限和下限间隔定义的粗略值来表示一个范围或一组值,同时使用帕累托最优思想解决多目标优化问题,有效提高了算法性能。Thangavel等人[8]提出了TACO-Miner(threshold ant colony optimization miner)方法,该方法是一种用于挖掘分类关联规则的改进蚁群优化算法,可以挖掘出具有更高预测精度及更为简单的分类规则。Wang 等人[9]提出了一种基于粒子群优化算法的关联规则挖掘方法,在分类数据上与传统Antminer算法相比具有更高的预测精度和更精简的规则集合。……