一种改进的高效用频繁集挖掘算法
2016-08-09汪峰坤张婷婷
宿州学院学报 2016年7期
关键词:数据挖掘
汪峰坤,张婷婷
安徽机电职业技术学院信息工程系,安徽芜湖,241000
一种改进的高效用频繁集挖掘算法
汪峰坤,张婷婷
安徽机电职业技术学院信息工程系,安徽芜湖,241000
摘要:运用(k-1)阶频繁集与1阶频繁集中较少项数的频繁集组合生成k阶频繁候选项、使用最大效用值系数、各阶频繁项集最大数目限制三种方法,对高效用频繁集数据挖掘经典算法Two-Phase进行了改进,研究了在低维数据集上不同数据量、高维数据集上不同数据量和不同维数数据集改进算法了运行时间。结果表明:改进方法的算法在高数据量和高维数据集中提高了算法运行效率,减少了运行时间。实验表明,在高维和百万数据级的数据集上,执行时间相对于Two-Phase算法至少节约了50%。
关键词:数据挖掘;关联规则;频繁项集;高效用项集
在经典的关联规则生成算法中,对事务数据库中所有的项集的重要性假定是同等的,仅仅是根据项集在事务集中出现的次数来判断项之间的关联情况。在实际的一些数据挖掘应用中,既要考虑项集出现的次数,又要考虑项集的重要性。例如,在职工体检中,不同的检测项的重要性是不一样的。
针对此类问题,B.Barber等提出了基于“效用”的挖掘概念[1]。项的“效用”值是用户设定的用于反应项的权重、收益、消费等内容的整数值。如果某项集的效用值不小于用户设定的阈值,则此项集被称为高效用频繁项集(HUI)。
基于效用的关联规则挖掘算法最基本的是枚举方法,其时空性能差,一般只用于验证其他算法的正确性。……
登录APP查看全文
