APP下载

分布式词向量研究和实现

2021-06-16唐国豪

电子制作 2021年2期
关键词:分类文本模型

唐国豪

(西北工业大学附属中学,陕西西安,710000)

1 研究背景

■1.1 研究意义

词是自然语言处理的最小单位,计算机中无法对词进行直接处理,因此需要采用数学的方式去表示词,通常采用的方式是词向量。常见的词向量有两种,分别是独热词向量和分布式词向量。分布式词向量表示相比于独热表示,具有向量维度小、具有语义相似性的特点。大规模数据训练得到的词向量,在各种下游任务如文本分类、文本聚类中表现超越传统方式,慢慢成为计算机处理自然语言的范式。

■1.2 国内外研究现状

Bengio在2003年提出了神经网络语言模型(Neural Network Language Model),该模型在学习语言模型的同时,得到了词向量。在对统计语言模型进行研究的背景下,Google公司在2013年开放了word2vec这一款用于训练词向量的软件工具。Word2vec可以根据给定的语料库,通过优化后的训练模型快速有效地将一个词语表达成向量形式,为自然语言处理领域的应用研究提供了新的工具。Tomas Mikolov在2013年提出的两种训练词向量方式CBOW(Continues Bag-of-Words Model)模型和Skip-Gram(Continuous Skip-gram Model)模型,CBOW的主要思想是用词的上下文预测当前词,可看作语言模型的神经网络表示,而Skip-gram模型与CBOW模型训练方式刚好相反,是通过当前词预测其上下文。facebook人工智能研究院(AI Research)在2016年开源了fastText,它是一个词向量与文本分类工具,用简单而高效的文本分类和表征学习的方法,解决了带监督的文本分类问题,FastText结合了自然语言处理和机器学习中最成功的理念。

2 相关技术综述

■2.1 中文分词

在自然语言处理中,词是语义理解的最小语言成分。……

登录APP查看全文

猜你喜欢

分类文本模型
一半模型
分类算一算
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本