APP下载

基于融合LDA和Doc2vec算法的文本表示模型的研究

2021-06-03莫秀良王春东佟寅铖

天津理工大学学报 2021年2期
关键词:单词分类文本

宁 宁,莫秀良,王春东,佟寅铖

(天津理工大学 计算机科学与工程学院 天津市智能计算及软件新技术重点实验室,天津 300384)

随着信息技术的不断发展,人们已经从信息缺乏的时代过渡到信息极为丰富的数字化时代,网络上的信息量正在飞速增长当中,为了能够在海量的文本中及时准确地获得有效的信息,文本分类技术已经成为近年来文本挖掘领域的热门话题[1].文本分类技术是指基于固定规则对指定文本进行监督学习的过程,它通常包括以下操作部分:预处理,文本表示,文本特征提取,分类算法,测试和评估[2],其中文本表示及特征提取十分影响分类器分类的效果.

文本表示分为离散表示和分布式表示.离散表示的代表就是词袋模型[3],它把文档集中的文档拆成一个个的词,去重后得到词典,进行文本表示.这种模型的特点是词典中的词没有特定的顺序,句子的总体结构也被改变了.因此,文本的离散表示存在着数据稀疏、向量维度过高、字词之间的关系无法度量的问题.

另一种是分布式表示也叫做词嵌入,它将单词分布在一个与实际语义高度相关的低维向量中.Word2vec是Google的Mikolov等人提出来的一种文本分布式表示的方法[4].这种方法弥补了词袋模型的缺点.利用将单词嵌入到另一个实数向量空间从而完成降维,并且单词的向量表示具备具体意义,向量之间的距离通常也能刻画在语料中两个单词之间的差异性.在此基础上……

登录APP查看全文

猜你喜欢

单词分类文本
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
看图填单词
教你一招:数的分类
看完这些单词的翻译,整个人都不好了
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
单词拾趣