一种不平衡数据的分类方法
2012-06-10李艳玲郭文普徐东辉
中国电子科学研究院学报 2012年3期
李艳玲,郭文普,徐东辉
(第二炮兵工程大学,西安 710025)
0 引 言
分类的基本过程是首先将一些具有类别标记的样本作为训练数据,通过学习算法获得分类器,然后根据分类器判定待分类样本的类别。因此,训练数据的质量直接影响学习算法获得的分类器性能。基于机器学习的分类方法要求训练数据比较完整及数据分布相对均匀等,当样本分布出现不平衡时,分类性能会降低[1~3]。然而,最近的一些研究认为[1~5],许多情况下,样本分布存在偏斜问题,尤其在两类分类中,不平衡问题更为多见。因此,对类别分布不平衡数据的学习已成为机器学习目前面临的一个挑战。目前对数据不平衡问题的解决方法主要集中在三个层次:一是数据集;二是分类方法;三是评估方法的优化。对于数据集,目前主要通过重取样,来构造分布均衡的训练数据集。对于分类方法则从采用新的分类策略、改进特征选择方法和权重润饰等角度进行改进。对于评估方法,如何根据评估结果来优化分类模型成为研究热点。但目前所有的方法都还不能对小类别的识别水平整体提高到实际可以接受的程度,相关的研究仍需进一步深入[4]。
已有的研究表明,将数据重取样与基于分类算法的改进二者结合起来的组合方法,效果要优于单纯使用一种类型的方法[6],但目前对组合方法的研究较少。以两类文本分类为背景,从数据重取样与特征权重润饰结合的角度考虑,提出一种基于组合的不平衡数据分类方法,通过相关实验,验证了该方法可有效提高不平衡数据分类精度。……
登录APP查看全文
