结合BERT和BiSRU-AT的中文文本情感分类*
2021-09-22黄泽民吴晓鸰吴迎岗
黄泽民,吴晓鸰,吴迎岗,凌 捷
(广东工业大学计算机学院,广东 广州 510006)
1 引言
通信领域的快速发展,促进了社交平台和网络运营商的发展,参与其中的网络用户越来越多,用户在各种平台上评论热点事件,发表自己的意见,从而产生海量的带有情感倾向的文本信息,而这些情感倾向对舆论监控、社会风气的分析、市场营销和政府部门有很大的作用[1]。但是,要利用这些情感文本,仅靠人工处理存在工作程序繁杂和实时性较差等问题[2]。自然语言处理领域的文本情感分析[3]又称意见挖掘,就是通过计算机来帮助人们自动获取、整理、归纳和推理文本,对评论文本进行倾向性分析,从而得到文本的情感倾向。
情感分析方法主要有基于机器学习和基于神经网络的方法。基于机器学习的文本情感分类方法,通过分析文本来构造结构化的特征数据,采用多种机器学习算法进行情感分析,如Pang等人[4]利用SVM(Support Vector Machine)、朴素贝叶斯、贝叶斯和最大熵等机器学习算法来对评论文本进行情感极性预测。但是,机器学习方法过多地依赖人工标注和领域知识去构造规范化的文本,使得迁移性差且耗费人力物力。基于神经网络的文本情感分类方法,就是将文本编码成向量,然后应用到下游的神经网络训练模型中。Salur等人[5]将不同的词向量化方法(如FastText、word2vec和字符级嵌入)与不同的深度学习方法(如CNN(Convolutional Neural Networks)、GRU(Gated Recurrent Unit)、LSTM(Long Short-Term Mermory network)、BiLSTM(Bi-directional Long Short-Term Mermory network)等)策略性地级联在一起,用不同的模型提取不同的特征,然后结合这些特征得到文本的情感极性。……
