APP下载

基于双向编码转换器和文本卷积神经网络的微博评论情感分类

2021-05-11徐凯旋潘亚磊

复杂系统与复杂性科学 2021年2期
关键词:单词分类文本

徐凯旋,李 宪,潘亚磊

(青岛大学 a.复杂性科学研究所;b.未来研究院,山东 青岛 266071)

0 引言

情感分类是情感分析中的一项基本任务,是对带有感情色彩的主观性文本进行分析、推理的过程[1]。它与传统的文本主题分类又不相同,传统主题分类是分析文本讨论的客观内容,而情感分类是要从文本中得到它是否支持某种观点的信息。情感分类也是文本分类的一种形式,其中必须将一段文本分类作为预定的情感分类之一,这是有监督的机器学习问题[2]。情感分类模型要求其输入是固定大小的数字向量。因此,需要将文本转换为固定大小的矢量,该矢量对文本的有意义的信息进行编码[3]。为此,已经提出了许多统计和深度学习NLP模型。

Mikolov[4]在2013年提出Word2vec模型,该模型有两种训练方法:1)通过周围单词预测当前单词;2)通过当前单词预测局部窗口单词。该模型将高维向量映射到低维空间中,解决了独热编码的维数爆炸问题;但是受到训练方法的影响,模型只考虑到了词的局部信息,没有考虑到词与局部窗口外单词的联系,词和向量属于一对一的关系,无法解决多义词的问题。2014年,Kim[5]提出基于Word2vec的文本卷积神经网络(Text Convolutional Neural Network,Text-CNN)模型用于句子分类任务,由Word2vec词向量作为文本卷积神经网络的输入,通过卷积操作进行特征检测,得到多个特征映射,然后通过池化操作对特征进行筛选,过滤噪音,提取关键信息用来分类。Jeffrey Pennington等人[6]在2014年提出了一种新的单词全局向量表示模型(Global Vectors for Word Representation,Glove),该模型是全局对数线性回归模型,采用全局矩阵分解和局部上下文窗口方法来学习词向量,将统计信息与局部上下文窗口方法的优点结合起来,其效果确实得到了提升。……

登录APP查看全文

猜你喜欢

单词分类文本
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
看图填单词
教你一招:数的分类
看完这些单词的翻译,整个人都不好了
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
单词拾趣