结合主题词嵌入和注意力机制的主题模型
2020-11-14覃婷婷陈可佳
计算机工程 2020年11期
覃婷婷,刘 峥,陈可佳
(南京邮电大学 计算机学院,南京 210023)
0 概述
随着互联网行业的快速发展,文档数据急剧增加,从文本数据中发现潜在的主题信息也变得更加困难。经典主题模型如LDA[1]和sentenceLDA[2]通常利用文档或者句子级别的单词共现来构成主题,根据简单的词袋模型捕获单词之间的语义信息,但是,该方法忽略了有价值的单词序列信息[3]。目前,研究人员提出了引入单词嵌入和主题嵌入的主题模型LTE(Latent Topic Enbedding)[3],其将单词嵌入和主题模型集成到一个框架中。单词嵌入模型[4]将单词映射到分布式表示中,其主要关注小滑动窗口内的单词共现,这使得单词嵌入可以捕获单词子序列的信息。但是,现有的单词嵌入模型通常只关注单词上下文的语义信息,并未充分了解文本的主题。
目前,学者们关于主题建模和单词嵌入进行了较多研究。LDA是用离散数据集合(如文本语料库)建立的生成概率模型[1],LDA及其变体已广泛应用于内容推荐[5-6]、趋势检测[7-8]以及用户概况分析[9-10]等应用中。Bigram主题模型[11-12]为了减轻LDA主题模型词袋假设的负面影响,为每一对主题的单词创建多项式分布,这导致其计算成本大幅增加。主题联合词向量模型[13]通过对单词和主题向量进行线性变换得到最终的词向量。文献[14]将主题模型应用于文档检索,在一定程度上提高了文档检索的效果。文献[4]提出了Skip-gram模型的几个扩展模型,提高了向量的质量和训练速度。文献[15]将主题建模的结果输入单词嵌入模型以学习主题词嵌入,但是其并非整合主题建模和单词嵌入。……
登录APP查看全文
