基于话题模型的科技文献话题发现和趋势分析
2012-06-29贺亮,李芳
中文信息学报 2012年2期
贺 亮,李 芳
(上海交通大学 计算机科学与工程系,上海 200240)
1 引言
在这个信息爆炸的时代,科学技术的发展也日新月异,对于科技工作者来说,需要快速获取相关领域的最新研究动态。为了了解最新的研究工作,科技工作者会关注该领域的关键问题,这些问题都用到了什么样的技术,在众多的技术中,哪些是目前的研究热点,哪些逐渐被人们淡忘。因此,对于科学技术趋势的自动分析研究,旨在帮助科学工作者从大量的学术会议和科技文献中提取出有用的信息,具有重要地现实意义。
要进行趋势分析,首先需要从大量的语料集合中提取出潜在的语义信息,亦可称之为话题。传统的VSM模型使用关键字来表示话题。但这种表达方式比较局限于对文档贡献较大的词,很多用于表示文档的词语,由于存在二义性,对于文档的语义上的描述,效果往往差强人意。为了克服VSM模型的这些缺点,有学者提出了语义模型[1-2]。首先是LSI模型[1],可以利用SVD技术对文本降维;进一步,在LSI模型中引入概率模型,得到pLSI模型[2],该模型是生成模型,它假设每篇文档是由多项式随机变量(话题)混合而成,而文档中每个词,由一个话题产生,文档中不同的词可有不同的话题生成。但是pLSI模型参数数量随着文集增长而线性增长,并且对于没有观测到的文本没有很好的预测。Blei[3]提出的LDA模型可以挖掘大规模语料的语义信息,是机器学习、信息检索等领域很流行的一个模型。LDA模型继承了pLSI模型的所有优点,可以很好的产生话题的分布;……
登录APP查看全文
