基于文本双表示模型的微博热点话题发现
2021-12-18刘梦颖
计算机与现代化 2021年12期
刘梦颖,王 勇
(北京工业大学信息学部,北京 100124)
0 引 言
随着信息技术的快速发展以及社交网络的兴起,通过互联网传播的信息量更是呈爆炸式增长。微博作为当前国内广泛使用的社交媒体平台之一,凭借其平台的开放性已经成为越来越多的网民表达自我情感、获取时事新闻、讨论社会舆论的重要平台[1]。
目前,针对微博平台的热点话题发现,众多学者已经开展了大量的研究工作。Chen等[2]通过计算每个单词的TF-ID值,即使用单词出现的频率衡量其是否为热词,进行热点话题挖掘。路荣等[3]采用LDA模型对微博文本进行隐主题建模,通过隐主题模型计算微博文本之间的相似度,进行话题聚类。Ye等[4]将微博中的点赞、评论、转发、时间、用户权限等微博特征信息添加到主题模型中,利用这些特征计算每个微博的关注价值、权威价值和词频,构造了微博新的主题模型MF-LDA,实验显示具有更好的准确性。陈珊珊[5]使用LDA模型来挖掘隐藏在数据中主题信息,使用主题信息来实现文本表示。Liu等[6]提出使用HowNet来扩展文本中单词的语义特征,以达到更好的聚类效果。为了进一步解决文本表示模型的高维问题,有学者提出将频繁词集的概念[7]应用于短文本聚类中,Zhang等[8]提出用挖掘的频繁词集作为特征来表示文本,并使用文本包含的频繁词集个数计算文本之间的相似度进行聚类。徐雅斌等[9]针对微博这一特殊媒体进行分析,提出使用频繁词集聚类FWSC(Frequent Words Sets Clustering)算法进行微博话题发现。……
登录APP查看全文
