APP下载

基于LDA的长短文本分类比较

2017-04-01王海林张雅君

数字技术与应用 2016年10期

王海林++张雅君

摘要:LDA作为一种常用的主题模型,在文本挖掘中作为特征选择的方法被广泛应用。但随着互联网中短文本信息的逐渐增多,短文本代表性词少的特点使得LDA对于短文本的主题挖掘不一定能够达到理想效果,这给LDA的应用带来了巨大挑战。为了探究LDA主题模型对短文本的分类效果,基于LDA,对长文本和短文本进行分类,对比分类效果,判断LDA对于短文本的适用性。

关键词:LDA 主题模型 文本分类 短文本

中图分类号:TP181 文献标识码:A 文章编号:1007-9416(2016)10-0230-01

Abstract:As a common method of topic mining, LDA is used as a method of feature selection in text mining widely. But with the increase in the number of short text, the result of LDA for the topic mining of short text may be not good. It is a challenge for LDA to deal with the few words .This paper classified the short text and long text based on LDA, respectively, compared the result, and estimated whether LDA is suitable for short text.

Key Words:LDA; topic model; text classification; short text

文本數据作为非结构化数据的一种,如何从中进行信息的提取,得到了高度的关注。微博、商品评论等信息都表现为短小、代表性词少等特征,LDA对于短文本的主题挖掘并不一定能够达到理想效果。因此,基于LDA对长、短文本进行分类,探究LDA主题模型对于短文本挖掘是否适用。

1 LDA主题模型概述

1.1 LDA基本思想

LDA主题模型[1]认为文档集合中所有的文档按照一定的概率共享某些潜在主题,而这些潜在的主题又可以由文档中的一些特征词来表示[2]。因此,就可以用一个三层贝叶斯模型来表示 “文档”、“主题”和“特征词”之间的关系,如图1所示。LDA模型可以表示为。

1.2 参数估计

LDA主题模型使用Gibbs抽样[3]对未知参数φ和θ进行估计,吉布斯更新规则为:参数估计。

2 实验数据及结果

2.1 实验数据集及预处理

长文本实验数据来源于微信公众号抓取的新闻数据,共社会、教育、健康等7个类别。短文本实验数据集来源于SODA上海开放数据创新应用大赛网格化管理数据,共有暴露垃圾、跨门营业和占道无证经营3个小类。……

登录APP查看全文