基于多样化特征的中文微博情感分类方法研究
2015-04-21张志琳宗成庆
中文信息学报 2015年4期
张志琳,宗成庆
(中国科学院 自动化研究所 模式识别国家重点实验室,北京 100190)
基于多样化特征的中文微博情感分类方法研究
张志琳,宗成庆
(中国科学院 自动化研究所 模式识别国家重点实验室,北京 100190)
随着Web 2.0时代的兴起,微博作为一个新的信息分享平台已经成为人们生活中一个重要的信息来源和传播渠道。近年来针对微博的情感分类问题研究也越来越多地引起人们的关注。该文深入分析了传统的情感文本分类和微博情感分类在特征表示和特征筛选上存在的差异,针对目前微博情感分类在特征选择和使用上存在的缺陷,提出了三种简单但十分有效的特征选取和加入方法,包括词汇化主题特征、情感词内容特征和概率化的情感词倾向性特征。实验结果表明,通过使用该文提出的特征选择和特征加入方法,微博情感分类准确率由传统方法的73.17%提高到了84.17%,显著改善了微博情感分析的性能。
中文微博;情感分类;机器学习; 特征选择
1 引言
微博是微博客(Micro Blog)的简称,是一种基于用户关系的信息分享、传播和获取的平台,用户可以通过WEB、WAP以及各种客户端组建个人社区,以140字左右的短文本更新信息,并实现及时分享*http://baike.baidu.com/view/1567099.htm。目前微博已经从各个方面渗透到了人们的日常生活和工作当中。以国内新浪微博为例,截止到2012年12月31日,用户数目已经超过了5亿人。
微博的快速发展引发了研究人员对于微博处理的兴趣。其中针对微博的情感分析研究是目前微博研究中最热,关注度最高的研究领域之一。……
登录APP查看全文
