APP下载

基于Spark的海量文本评论情感分析

2018-03-21奚雪峰顾建伟卓文婕陈帅天

关键词:分类文本情感

王 磊 , 曾 诚 , 奚雪峰 *, 皮 洲 , 顾建伟 , 卓文婕 , 陈帅天

(1.苏州科技大学 电子与信息工程学院,江苏 苏州 215009;2.苏州市虚拟现实智能交互及应用技术重点实验室,江苏 苏州215009;3.昆山市公安局指挥中心,江苏 苏州 215300)

随着网络的快速发展,越来越多的人活跃于网络,进行网络购物,进而产生大量的购物评论,购物评论不仅是用户在使用商品之后的一种反馈的有效方式,同时对于商户以及浏览者也都有较好的参考价值。但是目前绝大多数的评论都没有被有效利用,在浩如烟海的评论中,网站的管理者无法直接从中找到有用的信息,因而如何有效的挖掘处理这些评论具有重大意义。

最基础的情感分析方法是通过对句子进行打分来判定句子的情感类别。对句子中的每个单词都给予一个分数,例如带有乐观情感的单词得分为+1,带有悲观情绪的单词得分为-1。然后对句子中所有单词的得分进行求和得到一个最终的情感总分。

另外一个常见的方法是将文本视为一个“词袋”。将每个文本看成一个1×N的向量,其中N表示文本中包含的词汇的数量。该向量中每一列都是一个单词,其对应的值为该单词出现的频数。例如,词组“bag of bag of words”可以被编码为 [2,2,1]。这些数据可以被应用到机器学习分类算法中(如支持向量机,Logistic回归),从而预测未知数据的情感状况[1]。

Word2Vec[2]是由谷歌提出的一种模型,它包含两种不同的方法:Continuous Bag of Words(CBOW)和Skip-gram。CBOW的目标是根据上下文来预测当前词语的出现概率;而Skip-gram刚好相反,根据当前词语来预测上下文的概率。……

登录APP查看全文

猜你喜欢

分类文本情感
分类算一算
如何在情感中自我成长,保持独立
失落的情感
情感
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
如何在情感中自我成长,保持独立
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本