基于互信息的文本分类改进方法研究
2017-10-21余璇,孙伟,张翔
网络安全与数据管理 2017年19期
余 璇,孙 伟,张 翔
(上海海事大学 信息工程学院,上海 201306)
基于互信息的文本分类改进方法研究
余 璇,孙 伟,张 翔
(上海海事大学 信息工程学院,上海 201306)
传统的LDA主题模型没有考虑词频对主题分类的影响,使得主题分布向高频词倾斜。为了综合考虑词频和主题间的相关性,文中利用互信息能够表达变量间相关性的特点,在互信息基础上改进作为特征选择方法,利用评价函数评价特征词的权重值改进LDA算法分类过程,提高对主题分类贡献度高的特征词的作用。通过在新闻语料库上的分类实验证明了该方法的有效性,同时表明分类的准确率也有所提高。
主题模型;词频;互信息;特征选择
0 引言
文本分类是指在给定分类体系下,根据文本内容自动确定文本类别的过程,本质上是一种模式识别过程,它可以对文本的特征模式进行识别,关键技术有语料库的预处理、特征选择、分类模型构建等。主题模型[1](topic modeling)是一种常见的机器学习方法,可以自动提取隐含在文档集中的主题,并且按照词的分布形式直观地表达主题,无监督地分析文档和预测新文档,目前广泛应用于对文本的分类。其中LDA(Latent Dirichlet Allocation)[2]主题模型由于其参数简单,不产生过度拟合的现象,逐渐成为主题模型应用于文本分类的研究热点。根据zipf定律,文档中的词频分布符合幂律分布,在LDA主题模型学习时,这种幂律分布影响了词对主题间相关性的表达能力。针对这一现象,利用评价函数通过特征选择提取出文档中特征词,对特征集中的每一个特征词进行评估,选取特定数目的特征词组成特征子集表示文本,达到文本降维的目的。……
登录APP查看全文
