APP下载

改进LDA 模型的短文本聚类方法

2021-09-28俞卫国

软件导刊 2021年9期
关键词:语义文本模型

孙 红,俞卫国

(1.上海理工大学光电信息与计算机工程学院;2.上海现代光学系统重点实验室,上海 200093)

0 引言

聚类是一种无监督的机器学习方法,文本聚类是依靠文档特征将文本聚集为文档簇。随着互联网及信息技术的飞速发展,社区平台Twitter、新浪微博等普及,短文本呈爆炸式增长,对短文本聚类预处理具有重要价值。不同于传统媒体平台的文本信息,短文本具有以下特点:更新快速,存在大量不规范用语,吸收新词汇多,数据具有稀疏性,这给短文本聚类增加了难度。

常用的文本聚类算法通过计算文本的相似度信息,如VSM(Vector Space Model)模型,通过计算空间向量之间的余弦值来衡量文本的相似度。目前文本聚类主要应用有文本分类、文本可视化、搜索引擎聚类、信息推荐等。

20 世纪中后期,Gerard 等[1]提出VSM 空间向量模型并成功应用,但这种模型在计算空间相似度时计算量比较大,而且没有考虑词与词之间的内部联系。主题模型(Top⁃ic Model)考虑了词语与主题之间的内部联系,刘金亮[2]提出了一种改进的LDA(Latent Dirichletalloc Allocation)主题模型,使得LDA 模型的主题分布向高频词倾斜,导致能够代表主题的多数词被少量的高频词淹没,使主题表达能力降低;汪进祥[3]提出一种基于主题模型的微博话题挖掘,结合词性标注进行话题提取;张志飞等[4]基于潜在狄利克雷分配的新方法,提出基于LDA 主题模型的短文本分类方法,生成的主题不仅可以区分常用词的上下文并降低其权重,还可以通过连接区分词并增加其权重来减少稀疏性;……

登录APP查看全文

猜你喜欢

语义文本模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
语言与语义
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
3D打印中的模型分割与打包
“上”与“下”语义的不对称性及其认知阐释
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
认知范畴模糊与语义模糊
如何快速走进文本