基于改进关联分类的两次学习方法
2014-08-03黄再祥周忠眉何田中
计算机工程与科学 2014年7期
黄再祥,周忠眉,何田中
(漳州师范学院计算机科学与工程系,福建 漳州 363000)
1 引言
对于大型数据集,构建准确而高效的分类器是数据挖掘领域的一项主要任务。1998年,Liu B等[1]提出了将关联规则和分类相结合的关联分类方法。由于关联分类具有分类准确率高和易理解等特点,一直是分类领域的研究热点之一[2~7]。
关联分类算法主要包含类关联规则产生和分类两个阶段。类关联规则是后件为类别的特殊关联规则。通常使用改进的关联规则挖掘算法来产生类关联规则,如CBA[1]使用类Apriori[8]算法,CMAR[9]使用FPgrowth[10]算法产生类关联规则。由于产生的类关联规则数量众多,大多数关联分类算法采用相关的剪枝技术,从中选出一小部分高质量的规则来构建分类器。
在分类新实例时,与待分类实例匹配的多个规则的类别经常出现不一致的情况。目前,大多数关联分类算法解决这种规则冲突问题主要有三种策略:(1)使用优先级最高的单个规则,如CBA等。(2)使用优先级最高的k个规则,如CPAR[11]等。(3)使用所有匹配的规则,如CMAR等。对于前两种方法都需要首先确定规则的优先级,而不同的优先级排序算法对分类的准确率有较大影响[12]。对于后两种方法都需要对多个规则按类别分组并计算一组规则的强度,选择强度最大的组的类别作为待分类实例的类别。不同的规则强度计算方法对分类的准确率也有较大影响。
然而,在分类某些实例时,上述处理规则冲突的策略仍然很难将这些实例正确分类。……
登录APP查看全文
