一种中文伪评论语料半自动获取方法
2016-05-04郝秀兰许方曲蒋云良
中文信息学报 2016年1期
郝秀兰,许方曲,蒋云良
(湖州师范学院 信息工程学院,浙江 湖州 313000)
一种中文伪评论语料半自动获取方法
郝秀兰,许方曲,蒋云良
(湖州师范学院 信息工程学院,浙江 湖州 313000)
该文提出了一种中文伪评论语料半自动收集方法,主要包括数据收集、句法分析、情感倾向性分析等方法,并对影响方法正确性的错误进行了总结。文中着重介绍了一种句法分析方法,在句法分析的基础上提出了<评价对象,评价短语>的提取方法。该提取方法简化了情感二元对的句法呈现模式。同时,对部分实验结果进行了分析,对提高文本情感分析的准确率提出了一些建议。
计算机应用;中文信息处理;倾向性分析;伪中文评论;半自动获取
1 引言
情感分析(sentiment analysis)[1-3],又称观点挖掘(opinion mining),是指通过挖掘文本中的观点、看法、情绪、好恶等主观信息,对文本的情感倾向做出类别判断[4]。情感分析是网络舆情、互联网信息监控使用的关键技术之一。
除了在互联网舆情监控领域的应用[5],情感分析也被广泛应用于生活信息服务、医疗服务等关系民生的众多行业[6-8]。本文关注的是文本情感分析在电子商务中的应用。
电子商务网站中,有些特殊的评论:有的评论把好的产品/服务说成是不好的,有的把不好的产品/服务说成是好的,这两类评论合称为“伪评论”[1-2,8],伪评论是垃圾评论的一种。在现实中,这两类评论都是非常有害的,前者损害商家的利益,后者损害消费者的利益。但是,伪评论与真实评论混在一起,用人工的方法很难区分。……
登录APP查看全文
