中文文本分类技术比较研究
2016-01-13胡龙茂
安庆师范大学学报(自然科学版) 2015年2期
胡 龙 茂
(安徽财贸职业学院,安徽 合肥 230601)
中文文本分类技术比较研究
胡 龙 茂
(安徽财贸职业学院,安徽 合肥 230601)
摘要:文本分类中特征选择、权重计算及分类算法三个阶段中都存在一些经典方法,在实际的中文文本分类任务中,如何从各阶段不同方法的组合中找到一个好的组合成为值得研究的问题。比较研究中文文本分类中各阶段经典方法的不同组合对分类效果的影响结果表明:采用CHI特征选择方法、TFIDF权重计算方法及SVM分类方法的组合为最佳组合。
关键词:文本分类;特征选择;权重计算;分类算法
文本分类是在给定分类体系的情况下,根据文本的内容或属性将其分到预先定义的—个或多个类别。文本分类在自然语言处理与理解、信息检索、内容信息过滤等领域都有着广泛的应用。中文文本分类主要包括文本分词、特征选择、权重计算及使用分类算法进行分类四个步骤。国内外学者对特征选择、权重计算及分类算法展开了大量研究,在这三个阶段中都提出了不少经典的方法,这些方法的提出有效地提升了文本分类性能。
由于在各阶段有不同的方法可供选择,在实际的中文文本分类任务中,如何从各阶段不同方法的组合中找到一个好的组合成为值得研究的问题。文献[1-2]针对特征选择与分类算法的不同组合进行了比较研究,文献[3]研究了特征选择和权重计算方法的不同组合对分类效果的影响,都获得了一些提高分类效果的有益组合。……
登录APP查看全文
