基于关联分析的计算机软件数据挖掘技术
2021-04-21陈翠娟
安阳师范学院学报 2021年2期
陈翠娟
(福州理工学院,福建 福州 350506)
计算机硬件技术的发展为软件应用创造了良好条件,现代信息社会各领域工作离不开软件的应用,软件应用为各行业信息整理与快速获取创造便利[1]。计算机软件应用过程中随时产生大规模的应用数据、日志信息,反映了软件运行的一定规律。对于企业而言,计算机软件可能蕴藏海量有价值的财务信息、管理运营数据、人力资源管理信息,对其进行有效挖掘才能更好地利用这些软件大数据,提取有价值信息为企业运营创造利益[2]。本研究利用关联分析原理充分挖掘计算机软件内部蕴含的大数据,提出了基于改进Apriori算法挖掘计算机软件事务数据库的关联规则。
1 基于Apriori算法的计算机软件数据挖掘方法
1.1 Apriori算法基本原理
Apriori算法是以迭代的方式获取数据候选项集,利用剪枝操作选取候选项集中的频繁项集,在此基础上不断获得候选项集、生成频繁项集,当出现频繁项集量最大时可以终止迭代[3]。在Apriori算法中存在事务集合{G1,G2,…,Gm},也称为事务数据库,其中由差异项或者差异属性组成的集合可以表示为{I1,I2,…,In}。Apriori算法的项目集表示为E,包括E的事务集与事务总量的比值E⊆I称为支持度,频繁项集由此可以定义为“支持度不小于支持度阈值的项目集”,其余项目集则属于非频繁项集[4]。公式(1)为支持度计算公式,支持度表示数据库同时包含A和B事务的百分比:
supp(A⟹B)=P(AB)
(1)
公式(1)解释为在事务数据库中,数据库包含A与包含B的比值情况。
基于Apriori算法对计算机软件数据进行关联分析的过程基本分为两个步骤:一是找到软件事务数据库的全部频繁项集,定义为L;……
登录APP查看全文
