基于微博短文本的大数据分析方法探索与研究
2018-05-21宋啸天姚家伟
江苏通信 2018年1期
宋啸天 姚家伟
镇江市人民检察院
0 引言
中国互联网络信息中心(China Internet Network Information Center,CNNIC)在2017年1月发布了第39次《中国互联网络发展状况统计报告》,其中指出截至2016年12月,我国网民规模达7.31亿,手机网民规模达6.95亿,占比达95.1%,增长率连续3年超过10%。2017年5月,新浪微博发布2017年第一季度财报,截至3月31日,微博月活跃用户达3.4亿,位居世界第一。
国内在大数据分析领域的研究起步较晚,但是发展较快。中国社科院、人民日报社和国内多所大学于2006年就开始了相关研究,此外国内还有诸如中科点击(北京)科技有限公司的军犬网络舆情监控系统、红麦聚信(北京)软件技术有限公司的unotice舆情系统、南京绿色科技研究院的CCLA网络舆情分析系统等多个舆情分析软件,取得了较大的进展。
微博是一种兼具流行和新兴的社交方式,由于微博短文本中的语言表达较口语化,同时由于“未登录词”(没有被收录在分词词表中但必须切分出来的词,如缩写词汇、专有名词、新增词等)的存在,导致大数据分析的难度较大。本文针对以上问题,首先对需要进行预处理的微博文本内容进行了阐述,随后提出了一种基于“未登录词”的识别算法,并设计了面向微博短文本的聚类整合算法。
1 微博短文本预处理
短文本通常具有错误性大、时效性强、信息量少、词语更新频率快等特点。微博短文本除了具备以上共性特点外,还具备有语言符号化(以符号代替文字)、互动性强、词语省略等特点。所以,为了进行微博短文本大数据的有效分析,需要首先对文本内容进行处理,处理流程如图1所示。……
登录APP查看全文
