基于双向递归神经网络的多源社会情感数据分析*
2021-10-19吴文平高铭悦
吴文平 高铭悦
(宿州学院信息工程学院 安徽宿州 234000)
1引言
近十年来,社交媒体发展迅猛,如Twitter、Facebook、LinkedIn、微信、Instagram等都得到了广泛的应用。在这些社交媒体应用程序中,人们沉迷于以一种极其随意的方式表达自己的意见、建议、好恶和经历。这种非正式的互动方式促使研究者通过使用不同的工具和方法来理解和探索有价值的见解,如语音识别和情绪分析等。此外,它还与句法、词汇和语义规则有关的一些动态任务。
20世纪90年代,离散向量空间表示是流行的自然语言表示模型之一。这些模型包括词袋(bag of words,BOWs)、词频、倒排文档频率(term frequency-inverse document frequency,TF-CIDF)或计数向量器,用于特征提取。然而,人们发现这种技术在语义和单词排序上都存在问题。一些更多的整合,比如连续的单词包(continuous bag-of-words,CBOW)和N-Gram模型,大多是关于统计语言模型预测一个词[1],改进的方法是对连续词进行抽样和附加子抽样。后来密集词表示技术[2]被认为有助于通过N-Gram模型来处理信息稀疏的问题,即单词嵌入。在情感检测中,理解词义及其应用是至关重要的。因此,最好将其转化为向量空间模型,将其视为在文档分类、信息检索等多个领域使用的特征[3]。在自然语言学习中,主要依靠语音识别和模式识别技术来理解自然语言。随着人工智能(artificial intelligence,AI)的发展,深度神经网络(deep neural network,DNNs)克服了信息稀疏的问题,帮助算法学习,并使其能够训练具有相对较大数据集的复杂模型。利用神经网络捕捉语义对称性的能力,利用向量对词的嵌入,实现了神经网络的语义对称在语法或语义上相互关联。……
