APP下载

基于规则的二次学习分类方法

2019-10-21李莎莎

科学导报·科学工程与电力 2019年22期
关键词:数据挖掘分类

李莎莎

【摘  要】多数基于规则的分类方法对训练集学习一次,产生的规则数量较少,在预测未知实例时容易出现不匹配规则的情况,影响分类准确率。文中提出一种基于规则的二次学习方法RCDI(Rule-based classification with double induction),选取长度为1和2的频繁项建立候选集,频繁项包含正项以及负项。在候选集上搜索全局以及条件库最优值来产生规则,增大搜索空间。当测试出现规则不匹配或冲突的情况,则针对符合测试实例特征实例进行二次规则提取。实验表明,该算法不仅可行,而且提高了分类准确率。

【关键词】数据挖掘;分类;规则提取;二次学习

1 引言

分类是数据挖掘中重要的任务之一。传统的基于规则的分类算法通常重复搜索当前一个最优值或多个最优值来产生规则,并移除训练集中被这些规则覆盖的例子,例如 FOIL[1],CPAR[2] 和 CMER[3]等。这些分类方法选取生成规则的最优值时候选集中值数量少,搜索范围较小,导致产生的分类规则较少,在测试未知实例时极易出现规则不匹配的情况,在某些训练集上的分类准确率不高。Liu等提出了关联分类方法来产生关联规则[4]。大多数关联分类算法主要基于正关联模式来产生分类规则,如XTY的形式。如果是负相关则产生形如XT﹁Y 或者 ﹁X TY的负关联,﹁X代表不取x值。研究表明负关联模式也包含了非常有价值的信息,能更大范围的增大候选集的搜索空间,因而利用负关联模式进行分类同样具有十分重要的意义。 年,Liudgren等提出了二次学习方法,该方法在解决规则冲突方面有着明显的效果,但采用对冲突规则覆盖实例进行二次学习,无法解决无匹配规则的测试情况。……

登录APP查看全文

猜你喜欢

数据挖掘分类
分类算一算
垃圾分类的困惑你有吗
探讨人工智能与数据挖掘发展趋势
教你一招:数的分类
基于并行计算的大数据挖掘在电网中的应用
数据挖掘技术在中医诊疗数据分析中的应用
一种基于Hadoop的大数据挖掘云服务及应用
给塑料分分类吧
数据挖掘的分析与探索
基于GPGPU的离散数据挖掘研究