文本分类中基于改进特征选择方法的研究*
2016-08-10胡改蝶樊孝仁崔艺馨
计算机与数字工程 2016年7期
关键词:效率
胡改蝶 樊孝仁 崔艺馨
(太原工业学院网络与信息中心 太原 030008)
文本分类中基于改进特征选择方法的研究*
胡改蝶樊孝仁崔艺馨
(太原工业学院网络与信息中心太原030008)
摘要文本分类不仅可以提高分类的效率,而且可使人们更快地找到想要获取的信息。在特征选择方法的基础上,分析了卡方统计法的缺点,对其提出了一种改进的方法,同时采用支持向量机分类的算法和词频-逆向文件频率权重函数对其进行了验证。通过实验得出此方法可以在很大程度上提高文本分类精确度,使分类的效果更好。
关键词效率; 文本分类; 特征选择; 卡方统计法
Class NumberTP311
1引言
网络发展到现今,几乎所有的知识、信息和新闻等都可以从网络中得到,但如何将网络中的内容更好地进行分类,更加方便人们进行查找,便成了一个热门话题。文本分类是属于机器学习中的一个重要应用。文本分类就是将海量的且杂乱无章的文档集通过计算机将其分别归到不同的类别中,就像映射进程一样,即将一个新文档映射到现有的类别中去,这种映射有两种,一种是一对一,另一种是一对多[1]。从模式分类的角度来看,常见的文本分类方法有基于统计方法、基于连接方法和基于规则方法[2]。文本分类大致步骤是:第一步是预处理;第二步是从上一步的语料库中提取相应的特征,即特征提取;第三步是特征选择;最后,重新对一个新文档集进行分类[3]。
2特征选择概述
所有的分类都要依赖于文本训练样例的特征词规模,特征词的规模达到数万个是再正常不过的,甚至可以达到亿级,因而做出决策模型的时间就很长,并且如此大的维数非常容易造成维度灾难。……
登录APP查看全文
