分布式词向量研究和实现
2021-06-16唐国豪
唐国豪
(西北工业大学附属中学,陕西西安,710000)
1 研究背景
■1.1 研究意义
词是自然语言处理的最小单位,计算机中无法对词进行直接处理,因此需要采用数学的方式去表示词,通常采用的方式是词向量。常见的词向量有两种,分别是独热词向量和分布式词向量。分布式词向量表示相比于独热表示,具有向量维度小、具有语义相似性的特点。大规模数据训练得到的词向量,在各种下游任务如文本分类、文本聚类中表现超越传统方式,慢慢成为计算机处理自然语言的范式。
■1.2 国内外研究现状
Bengio在2003年提出了神经网络语言模型(Neural Network Language Model),该模型在学习语言模型的同时,得到了词向量。在对统计语言模型进行研究的背景下,Google公司在2013年开放了word2vec这一款用于训练词向量的软件工具。Word2vec可以根据给定的语料库,通过优化后的训练模型快速有效地将一个词语表达成向量形式,为自然语言处理领域的应用研究提供了新的工具。Tomas Mikolov在2013年提出的两种训练词向量方式CBOW(Continues Bag-of-Words Model)模型和Skip-Gram(Continuous Skip-gram Model)模型,CBOW的主要思想是用词的上下文预测当前词,可看作语言模型的神经网络表示,而Skip-gram模型与CBOW模型训练方式刚好相反,是通过当前词预测其上下文。facebook人工智能研究院(AI Research)在2016年开源了fastText,它是一个词向量与文本分类工具,用简单而高效的文本分类和表征学习的方法,解决了带监督的文本分类问题,FastText结合了自然语言处理和机器学习中最成功的理念。
2 相关技术综述
■2.1 中文分词
在自然语言处理中,词是语义理解的最小语言成分。……
