APP下载

基于Word2vector的文本特征化表示方法

2018-06-04周顺先林霜巧龚德良王鲁达

关键词:语义特征文本

周顺先,蒋 励,,林霜巧,龚德良,王鲁达

(1.湘南学院 软件与通信工程学院,湖南 郴州 423000,2.中南大学 信息科学与工程学院,长沙 410075)

0 引 言

目前,针对信息检索任务中的文本,在无法直接识别其词语语义的情况下,多采用基于词语统计的样本特征化表示方法,例如词频-逆向文件频率模型[1-2](term frequency-inverse document frequency,TF-IDF)模型与词袋[3](bag of words,BOW)模型。现行的基于词语统计的特征化表示方法可在无语义规则支持的情况下实现文本特征化表示,但将忽略词语语义,无法有效地提取其词语语义特征。

Word2vector最先由Mikolov在2013年提出,该方法能够简单、高效获取词义的向量化特征,引起业界的极大关注。当文本作为信息检索的样本时,针对在不同文本中的每个词语,Word2vector可依据其上下文关系有效地提取其语义(即词语语义特征),并以词向量提供形式化表达[4]。因此,Word2vector的词义特征提取无需语义规则库。由于Word2vector的词义特征提取机制的复杂性,使得不同文本中相同的词所对应的词向量并不相同。难以根据Word2vector的词向量形成文本的特征化表示,尤其难以形成向量空间模型(vector space model,VSM)[5]形式的样本特征化表示。

Mikolov在相关论文[6]中说明了Word2vector的机制。部分技术开发人员已对word2vec中的数学原理进行了深入的剖析[7]。在此基础之上,西南大学唐明等[8]提出一种文档向量表示的方法,应用与中文文档的分类;华东师范大学计算机应用研究所杨河彬等[9]提出CT-Word2Vec神经网络语言模型,利用词汇的上下文信息将词转化成向量,在词向量的学习过程当中融入了用户的搜索点击行为。……

登录APP查看全文

猜你喜欢

语义特征文本
语言与语义
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
“上”与“下”语义的不对称性及其认知阐释
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
认知范畴模糊与语义模糊
如何快速走进文本
线性代数的应用特征