基于关联规则与相似度的数据挖掘算法研究
2021-11-09李英,汤庸
李 英, 汤 庸
(华南师范大学计算机学院, 广州 510631)
数据挖掘作为全球范围内快速兴起的一门交叉学科,结合了多个领域技术,包括数理统计、数据库技术、人工智能和机器学习等领域的理论和技术. 一般意义上,数据挖掘的分析方法主要有人工神经网络法、决策树法、分类分析法、聚类分析法、关联规则分析法和序列模式分析法等,针对不同领域的具体业务问题,选择合适的分析方法可以得到更加有效的结果.
关联规则分析是在数据集中找出各项之间的关联关系的分析方法[1],是数据挖掘中最活跃的研究方法之一. 1994年,AGRAWAL和SRIKANT[2]提出了基于频繁集模式生成关联规则的Apriori算法. 由于Apriori算法存在反复扫描数据库的缺点, 许多学者在提升关联规则算法效率以及不同应用领域进行了大量研究. 如:提出了对比规则集模式的SCR-Apriori算法,通过将模式结构的知识引入Apriori算法,显著地缩减了待分析频繁项集的搜索空间[3];在传统关联规则支持度和置信度的基础上,在领域数据中增加效用度和有趣度来消除关联冗余,有助于挖掘出有效的关联规则[4];提出基于项权值排序的加权关联规则挖掘算法,可用于各种语言的信息检索,以改善检索性能[5];提出了基于权值向量矩阵约简的Apriori算法,通过不断约简矩阵结构、降低源数据和候选项集规模,提高了运算效率[6];对基于MapReduce模型的Apriori算法进行了改进,减少了数据库扫描次数,且并行计算频繁项集,提高了算法的效率[7];综合利用Word2Vec和K-means算法等技术,提出了一种无监督Apriori学习算法来分析和挖掘地质大数据中的关联规则,有效地挖掘矿床数据中的潜在关系和规律[8];……