APP下载

基于主题模型的短文本分类研究

2016-10-21王海林张雅君

中国管理信息化 2016年19期
关键词:分类实验方法

王海林,张雅君

(山西财经大学 信息管理学院,太原 030006)

基于主题模型的短文本分类研究

王海林,张雅君

(山西财经大学信息管理学院,太原030006)

分本分类作为文本挖掘的分支,得到了广泛的关注和迅速的发展。基于主题模型,针对短文本分类进行研究,选取LDA和BTM主题模型和SVM、Bagging和AdaBoost分类方法进行短文本分类实验,并对实验结果进行评价。

主题模型;短文本分类;LDA;BTM

1 引言

随着信息技术的快速发展和网络的广泛使用,互联网中产生的信息显著增加。大量非结构化数据已经成为网络数据的主力军,可以占到总数据量的90%[1],短文本更是在社交网站中随处可见。主题模型作为特征选择的一种方法,常用于文本分类中。使用不同的分类方法,对比LDA和BTM模型对于短文本特征选择的效果。

2 主题模型

2.1主题模型思想

主题模型是一种层次结构的模型,用概率来表示各层之间的关系,常见的有 PLSA[2]、LDA[3]和 BTM[4]等,PLSA即潜在语义分析,是最早的主题模型,它使用条件概率描述单词和潜在类别间的关系,并使用最大期望的方法训练潜在类别。

2.2 LDA模型

由于PLSA模型的不完备和容易出现过拟合等缺陷[4],Blei等人提出了LDA模型,用概率来表示文档集合层、文档层和词语层之间的关系。

在LDA模型中:

(1)每篇文档主题词的个数N~Possion(ξ);

(2)文档中先验概率θ~Dir(α);

(3)每篇文档的第n个主题词wn:

主题Zn~Multinomial(θ);

主题词wn~Multinomial(wn|Zn,β)。

所以,LDA模型可以表示为:

其中P(φ|β),代表主题概率,P(w|φ)P(z|θ)代表主题词概率,P(w|φ)P(z|θ)P(θ|φ)代表文档概率。

参数估计:

2.3 BTM模型

BTM是另一种三层贝叶斯结构模型,与LDA不同的是它用“词对”来代替词,从而克服了短文本中词少所带来的困难。……

登录APP查看全文

猜你喜欢

分类实验方法
记一次有趣的实验
分类算一算
做个怪怪长实验
教你一招:数的分类
NO与NO2相互转化实验的改进
实践十号上的19项实验
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼