混合CHI和MI的改进文本特征选择方法
2018-04-13邱晓晖
王 振,邱晓晖
(南京邮电大学 通信与信息技术学院,江苏 南京 210003)
0 引 言
随着信息技术的迅猛发展,网络上的数据呈现爆炸式的增长,而其中以文本数据居多。如何对众多的文本进行快速分类,成为了研究的热点,文本分类也由此产生并不断发展。文本分类是在给定类别的情况下,根据文本的内容,将其自动划分到一个或者几个预先给定的类别中[1]。文本分类主要由分词、预处理、特征选择、特性降维、分类算法、分类性能评估等几个步骤构成[2]。在构建特征向量时,如何降低向量的维数一直是需要解决的问题。因为一般大小的数据集经过提取就有上万个特征,大一点的数据集甚至能达到上百万个特征,这么高的维数不仅对计算产生了很大的负担,而且很多特征对分类而言都是无用的,还会降低分类的准确度。因此,可以通过特征选择方法,降低特征向量的维数,减少分类算法的运行时间,从而最终提高分类准确度。一直以来,特征选择问题都是研究的重点问题[3-5]。
目前,文本分类中常用的特征选择算法有文档频数(document frequency,DF)、卡方统计量(CHI-square statistic,CHI)、信息增益(information gain,IG)、互信息(mutual information,MI)、期望交叉熵(expected cross entropy,ECE)、文本证据权(weight of evidence for text,WET)等。美国卡内基梅隆大学的Yang教授对以上几种特征选择方法进行比较分析发现,CHI和IG方法的分类效果相对较好,但CHI方法相比IG方法的分类准确度更高[6]。因此,针对CHI的优缺点进行深入研究,探索该模型的改进途径对提高文本的分类准确度具有重要意义。近年来,很多研究者都对CHI进行了研究改进[7-9]。……
