基于改进CHI和TF-IDF的短文本分类的研究
2021-06-29代继鹏邵峰晶孙仁诚
计算机与现代化 2021年6期
代继鹏,邵峰晶,孙仁诚
(青岛大学计算机科学技术学院,山东 青岛 266071)
0 引 言
文本分类是在给定分类体系的情况下,根据文本的内容或属性将其分到一个或多个预定义的类别[1]。文本分类的主要步骤包括文本预处理、特征选择模型训练以及效果评估[2]。文本分类中常常会遇到特征空间的维度太高,导致计算量巨大,分类效果不好,主要是因为选择的特征词数量巨大。进行有效的特征选择可以极大减少选取特征词数量,大幅度降低特征空间维数,能够提高分类的效率和精度。因此,在进行文本分类中,特征选择就显得至关重要[3]。特征选择降低空间维度的主要方式是在高维空间中选择出带有大部分文本信息的特征词,用这些特征词代表文本,从而有效地提高文本分类的效率和精度。因为特征选择在文本分类中的作用极其重要,所以不少国内外研究学者致力于改进特征选择方法。Salton等人[4]在1983年提出结合词频权重和反文档频率计算方法,即TF-IDF(Term Frequency-Inverse Document Frequency)算法。英国统计学家Karl Pearson在1900年首次提出卡方统计量用于卡方检验,用来验证类别和变量之间是否存在相关性,发展至今已经是文本分类中特征选择方法中比较常用、效果比较好的特征选择方法[5]。Jin等人[6]使用样本方差计算词的分布信息,并考虑最大词频信息来改进CHI(Chi-Square Statistic)方法,在3个数据集上均取得较好的结果。高宝林等人[7]通过引入类内和类间分布因子,提出了基于类别的CHI特征选择方法,对低频词进一步处理,主要针对特征词类别间均匀分布的情况,来降低其权重。……
登录APP查看全文
