基于融合LDA和Doc2vec算法的文本表示模型的研究
2021-06-03莫秀良王春东佟寅铖
天津理工大学学报 2021年2期
宁 宁,莫秀良,王春东,佟寅铖
(天津理工大学 计算机科学与工程学院 天津市智能计算及软件新技术重点实验室,天津 300384)
随着信息技术的不断发展,人们已经从信息缺乏的时代过渡到信息极为丰富的数字化时代,网络上的信息量正在飞速增长当中,为了能够在海量的文本中及时准确地获得有效的信息,文本分类技术已经成为近年来文本挖掘领域的热门话题[1].文本分类技术是指基于固定规则对指定文本进行监督学习的过程,它通常包括以下操作部分:预处理,文本表示,文本特征提取,分类算法,测试和评估[2],其中文本表示及特征提取十分影响分类器分类的效果.
文本表示分为离散表示和分布式表示.离散表示的代表就是词袋模型[3],它把文档集中的文档拆成一个个的词,去重后得到词典,进行文本表示.这种模型的特点是词典中的词没有特定的顺序,句子的总体结构也被改变了.因此,文本的离散表示存在着数据稀疏、向量维度过高、字词之间的关系无法度量的问题.
另一种是分布式表示也叫做词嵌入,它将单词分布在一个与实际语义高度相关的低维向量中.Word2vec是Google的Mikolov等人提出来的一种文本分布式表示的方法[4].这种方法弥补了词袋模型的缺点.利用将单词嵌入到另一个实数向量空间从而完成降维,并且单词的向量表示具备具体意义,向量之间的距离通常也能刻画在语料中两个单词之间的差异性.在此基础上……
登录APP查看全文
