APP下载

基于互信息的文本分类改进方法研究

2017-10-21余璇,孙伟,张翔

网络安全与数据管理 2017年19期
关键词:分类文本方法

余 璇,孙 伟,张 翔

(上海海事大学 信息工程学院,上海 201306)

基于互信息的文本分类改进方法研究

余 璇,孙 伟,张 翔

(上海海事大学 信息工程学院,上海 201306)

传统的LDA主题模型没有考虑词频对主题分类的影响,使得主题分布向高频词倾斜。为了综合考虑词频和主题间的相关性,文中利用互信息能够表达变量间相关性的特点,在互信息基础上改进作为特征选择方法,利用评价函数评价特征词的权重值改进LDA算法分类过程,提高对主题分类贡献度高的特征词的作用。通过在新闻语料库上的分类实验证明了该方法的有效性,同时表明分类的准确率也有所提高。

主题模型;词频;互信息;特征选择

0 引言

文本分类是指在给定分类体系下,根据文本内容自动确定文本类别的过程,本质上是一种模式识别过程,它可以对文本的特征模式进行识别,关键技术有语料库的预处理、特征选择、分类模型构建等。主题模型[1](topic modeling)是一种常见的机器学习方法,可以自动提取隐含在文档集中的主题,并且按照词的分布形式直观地表达主题,无监督地分析文档和预测新文档,目前广泛应用于对文本的分类。其中LDA(Latent Dirichlet Allocation)[2]主题模型由于其参数简单,不产生过度拟合的现象,逐渐成为主题模型应用于文本分类的研究热点。根据zipf定律,文档中的词频分布符合幂律分布,在LDA主题模型学习时,这种幂律分布影响了词对主题间相关性的表达能力。针对这一现象,利用评价函数通过特征选择提取出文档中特征词,对特征集中的每一个特征词进行评估,选取特定数目的特征词组成特征子集表示文本,达到文本降维的目的。……

登录APP查看全文

猜你喜欢

分类文本方法
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
用对方法才能瘦
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
四大方法 教你不再“坐以待病”!
捕鱼
如何快速走进文本