一种基于区分能力的多类不平衡文本分类特征选择方法
2015-04-21张延祥潘海侠
中文信息学报 2015年4期
张延祥,潘海侠
(北京航空航天大学 软件学院,北京 100191)
一种基于区分能力的多类不平衡文本分类特征选择方法
张延祥,潘海侠
(北京航空航天大学 软件学院,北京 100191)
文本分类中的不平衡数据问题在现实应用中比较普遍。传统的特征选择方法在不平衡问题上倾向于多数类而忽略稀有类。针对这种倾向性该文提出了一种主导性分析量化方法,并基于对该方法的优化提出了一种基于类别区分能力的特征选择方法,即DA(Discriminative Ability)方法,该方法使用文档概率的最小绝对值差作为评分标准,一定程度上保证了特征选择在稀有类与多数类上的公平性。实验表明,DA优于CHI、IG、DFICF,尤其在F1宏平均指标上,DA在不平衡问题上能够取得更好的降维效果。
文本分类;不平衡问题;特征选择;主导性分析;区分能力
1 引言
互联网的快速发展使得信息呈现爆发式增长的态势,如何有效管理这些数据成为当前的热点问题。文本分类作为海量数据管理的关键技术,在信息检索、数据挖掘、舆情监测等方面均有着广泛应用。
近年来,基于机器学习的分类方法被应用到文本分类中,取得了很好的效果。但在实际应用中,数据集分布偏斜仍是一个亟待解决的问题[1],尤其在具有高维特点的文本分类问题上。
数据集分布不平衡问题一般是指样本在类别间可能存在数量级的差别,在这种情况下,样本无法准确地反映整个空间的类别分布,特征降维方法与分类算法都倾向于被大类主导而忽略小类,是导致分类效果不理想的重要因素。……
登录APP查看全文
