基于频繁词网络的LDA最优主题个数选取方法
2018-08-21李菲菲王移芝
计算机技术与发展 2018年8期
李菲菲,王移芝
(北京交通大学 计算机与信息技术学院,北京 100044)
0 引 言
随着移动互联网的快速发展,网络信息量特别是文本信息呈指数增长,因此如何精准有效地挖掘、组织和利用海量文本背后的有用信息成为一个热门话题。文本聚类技术作为自然语言处理(natural language processing,NLP)的预处理步骤,对文本进一步分析和处理有着重要影响,比如信息检索、生成文档摘要等,在文本聚类方面,主题聚类[1]方法比传统方法更有效。于是,隐含狄利克雷分布(latent Dirichlet allocation,LDA)在挖掘文档中的隐含主题方面得到了越来越多的应用。
LDA[2]主题模型在2003年由普林斯顿大学的David M.Blei等提出,该模型是一种文本建模方法,能够将每篇文档的主题以概率分布的形式给出,用来识别大规模文本或者视频中隐含的主题信息,在信息检索、文本分类等领域应用非常广泛。目前普遍认为应用基于吉布斯采样[3]的LDA的最大问题是无法确定最优主题数目,然而主题数目的选取直接影响到LDA主题模型的性能,导致文档分布表示存在精度误差。
在大规模语料库中,文档集的聚类簇数通常与句子集中隐藏的主题数目一致,前者作为后者的先验知识。根据频繁词网络[4]隐含社区个数与文档集隐含主题数相一致的特点,文中提出了一种以频繁词集网络的社区划分个数用来指定LDA主题模型主题输入个数的方法,使得指定主题数更加接近文档分布表征的隐含主题数目。
1 相关工作
1.1 研究现状
大量研究表明,LDA主题抽取效果[5]与潜在主题的数量直接相关,主题抽取的结果对主题数目非常敏感。……
登录APP查看全文
