基于BERT 的中文文本向量化表示
2021-11-15祖成
科技与创新 2021年21期
祖成
(首都经济贸易大学管理工程学院,北京 100070)
在自然语言处理领域,将普通文本转换成计算机可计算的形式,即文本表示一直是研究的热点问题。初期,文本在经过简单的分词之后使用one-hot 向量对所分单词进行向量表示。但one-hot 向量仅仅利用了单词的相关位置信息,并未考虑单词的语义信息,导致所获的词向量缺少文本语义信息的参与。为了获得更多的语义信息,MIKOLOV[1]等人提出了基于深度表示的模型Word2Vec。Word2Vec 模型包含Skip-Gram 和CBOW 两种形式,其基本思路都是为输入文本搭建一个具备上下文信息的神经网络,计算得到含有上下文信息的词向量。两者的区别在于Skip-Gram 通过中间单词预测上下文信息,CBOW 则利用上下文信息预测中间单词。与Word2Vec 思路相似的还有GloVe 模型[2],虽然以上模型可以利用上下文信息预测词向量使得生成的词向量包含了寓意信息,但由于其构建过程是单向学习,无法解决一词多义或者新词组合的情况。针对以上问题,本文引入动态词向量 BERT 模型[3],BERT 模型利用其独特的Transformer 结构对文本进行双向学习和处理,利用self-attention 学习词间关系,使得词向量的表示能够融入句子级的语义信息,从而解决词向量无法表示一词多义的情况,同时为了加强单个词对整篇文档的影响力,利用TF-IDF 算法[4]计算每篇文档中词的权重,结合BERT 词向量构建具有权重信息的词向量,提高文本分类的准确率。
1 BERT 模型
BERT 模型与以往的词向量模型相比独到之处在于它的输入是3 个向量的和。3 个向量分别对应词向量、分段向量和位置向量。……
登录APP查看全文
