基于改进CHI和PCA的文本特征选择*
2021-09-22万玉辉张许红文志云
文 武,万玉辉,张许红,文志云
(1.重庆邮电大学通信与信息工程学院,重庆 400065;2.重庆邮电大学通信新技术应用研究中心,重庆 400065; 3.重庆信科设计有限公司,重庆 401121)
1 引言
文本分类是大数据分析的关键技术,在舆情分析、主题分类、情感分析、邮件过滤和金融预测等诸多现实领域中有着广泛的应用。面对海量的文本数据,文本特征空间的高维稀疏性严重影响了分类器的训练效率及分类精度。因此,从文本中选出与类别属性相关性较强的特征词,降低数据维度,剔除噪声和冗余特征,具有重要研究意义。
目前常用的特征选择算法有文档频率DF(Document Frequency)[1]、互信息MI(Mutual Information)[2]、卡方检验CHI(CHI-square Statistics)[3]和信息增益IG(Information Gain)[4]等。这些方法虽然能够实现对高维度特征向量的缩减,提高分类精度,但都存在局限性,许多学者对此进行了改进。董微等[5]在IG中引入自适应比例因子来调节正负相关特性,通过贝叶斯分类器在不同语料库下,取得了较好的分类效果。刘海峰等[6]在MI中通过修正因子对低频词进行抑制,改善了互信息的选择效率。宋呈祥等[7]在CHI中根据词的位置计算权重及相关性系数,提升了分类效果。此外,依靠群智能算法较强的寻优能力,王生武等[8]融合粗糙集和鲸鱼优化算法,引入了以属性依赖度和分类准确率进行加权的适应度函数,提升了分类准确率。刘成锴等[9]在词频-逆文档频TF-IDF(Term Frequency-Inverse Document Frequency)的基础上,用遗传算法对文本特征进行再次选择,大幅度降低了特征维度。为了更进一步去除冗余特征,Uguz[10]通过结合信息增益和主成分分析法,提升了分类精度。……
