基于主题模型的短文本分类研究
2016-10-21王海林张雅君
王海林,张雅君
(山西财经大学 信息管理学院,太原 030006)
基于主题模型的短文本分类研究
王海林,张雅君
(山西财经大学信息管理学院,太原030006)
分本分类作为文本挖掘的分支,得到了广泛的关注和迅速的发展。基于主题模型,针对短文本分类进行研究,选取LDA和BTM主题模型和SVM、Bagging和AdaBoost分类方法进行短文本分类实验,并对实验结果进行评价。
主题模型;短文本分类;LDA;BTM
1 引言
随着信息技术的快速发展和网络的广泛使用,互联网中产生的信息显著增加。大量非结构化数据已经成为网络数据的主力军,可以占到总数据量的90%[1],短文本更是在社交网站中随处可见。主题模型作为特征选择的一种方法,常用于文本分类中。使用不同的分类方法,对比LDA和BTM模型对于短文本特征选择的效果。
2 主题模型
2.1主题模型思想
主题模型是一种层次结构的模型,用概率来表示各层之间的关系,常见的有 PLSA[2]、LDA[3]和 BTM[4]等,PLSA即潜在语义分析,是最早的主题模型,它使用条件概率描述单词和潜在类别间的关系,并使用最大期望的方法训练潜在类别。
2.2 LDA模型
由于PLSA模型的不完备和容易出现过拟合等缺陷[4],Blei等人提出了LDA模型,用概率来表示文档集合层、文档层和词语层之间的关系。
在LDA模型中:
(1)每篇文档主题词的个数N~Possion(ξ);
(2)文档中先验概率θ~Dir(α);
(3)每篇文档的第n个主题词wn:
主题Zn~Multinomial(θ);
主题词wn~Multinomial(wn|Zn,β)。
所以,LDA模型可以表示为:

其中P(φ|β),代表主题概率,P(w|φ)P(z|θ)代表主题词概率,P(w|φ)P(z|θ)P(θ|φ)代表文档概率。
参数估计:

2.3 BTM模型
BTM是另一种三层贝叶斯结构模型,与LDA不同的是它用“词对”来代替词,从而克服了短文本中词少所带来的困难。……
