APP下载

基于主题-词向量的多粒度特征协同表达多义词研究

2021-09-09汪静徐昶王莹莹

现代计算机 2021年19期
关键词:语义分类文本

汪静,徐昶,王莹莹

(1.湖北广播电视大学软件工程学院,武汉 430074;2.湖北广播电视大学导学中心,武汉 430074)

0 引言

随着移动终端的普及和网络的高速发展,人们在媒体平台上自由发表评论,由此产生了大量文本数据。如何从爆发式增长的文本中筛选出有效信息是当前的研究热点,而文本自动分类可以适当解决这一问题。因此,如何通过文本分类技术挖掘文本的潜在价值,成为目前广泛关注的一项任务。

文本分类是计算机依据对文本内容的分析,将其判别为提前确定好的类别中的一类或几类[1]。其中文本表示是文本分类的前提保障,其质量的好坏对分类效果造成直接影响,传统的文本表示方法大多基于空间向量模型(VSM)[2]和主题模型[3]。近几年随着深度学习理论的逐渐成熟和硬件设备的有力支撑,新兴模型Word2Vec[4]进入行业大众视野,其根据上下文语义关系映射出词语在空间中的位置,成为文本表示的新方法。2013年Word2Vec工具的开源使词向量受到界内研究者的追捧,并在各类自然语言处理任务中展现了巨大的应用潜力。如Fan[5]、Yao[6]等人分别将Word2Vec应用于问答系统中多标签文本分类问题和大规模新闻文本分类问题中,分类效果较传统的文本分类方法均有较大提升。

然而汉语词汇中存在大量一词多义的现象,Word2Vec模型单纯用唯一的词向量混合表示词语的多重语义显然是不合理的,业内学者对此展开了相关研究。Tian[7]假设所有的单词具有相同的语义个数,通过Skip-Gram模型使用概率混合模型学习词向量的表达,但这种假设与实际情况相违背,可借鉴性不大。……

登录APP查看全文

猜你喜欢

语义分类文本
分类算一算
语言与语义
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
“上”与“下”语义的不对称性及其认知阐释
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
认知范畴模糊与语义模糊
如何快速走进文本
语义分析与汉俄副名组合