改进LDA 模型的短文本聚类方法
2021-09-28俞卫国
软件导刊 2021年9期
孙 红,俞卫国
(1.上海理工大学光电信息与计算机工程学院;2.上海现代光学系统重点实验室,上海 200093)
0 引言
聚类是一种无监督的机器学习方法,文本聚类是依靠文档特征将文本聚集为文档簇。随着互联网及信息技术的飞速发展,社区平台Twitter、新浪微博等普及,短文本呈爆炸式增长,对短文本聚类预处理具有重要价值。不同于传统媒体平台的文本信息,短文本具有以下特点:更新快速,存在大量不规范用语,吸收新词汇多,数据具有稀疏性,这给短文本聚类增加了难度。
常用的文本聚类算法通过计算文本的相似度信息,如VSM(Vector Space Model)模型,通过计算空间向量之间的余弦值来衡量文本的相似度。目前文本聚类主要应用有文本分类、文本可视化、搜索引擎聚类、信息推荐等。
20 世纪中后期,Gerard 等[1]提出VSM 空间向量模型并成功应用,但这种模型在计算空间相似度时计算量比较大,而且没有考虑词与词之间的内部联系。主题模型(Top⁃ic Model)考虑了词语与主题之间的内部联系,刘金亮[2]提出了一种改进的LDA(Latent Dirichletalloc Allocation)主题模型,使得LDA 模型的主题分布向高频词倾斜,导致能够代表主题的多数词被少量的高频词淹没,使主题表达能力降低;汪进祥[3]提出一种基于主题模型的微博话题挖掘,结合词性标注进行话题提取;张志飞等[4]基于潜在狄利克雷分配的新方法,提出基于LDA 主题模型的短文本分类方法,生成的主题不仅可以区分常用词的上下文并降低其权重,还可以通过连接区分词并增加其权重来减少稀疏性;……
登录APP查看全文
