基于层次分析的微博短文本特征计算方法
2016-06-21邹学强包秀国黄晓军马宏远袁庆升
通信学报 2016年12期
邹学强,包秀国,黄晓军,马宏远,袁庆升
(1.中国科学院信息工程研究所,北京 100093;2.国家计算机网络应急技术处理协调中心,北京 100029;3.中国科学院大学,北京100049;4.北京邮电大学信息与通信工程学院,北京 100876)
基于层次分析的微博短文本特征计算方法
邹学强1,2,3,包秀国2,黄晓军4,马宏远2,袁庆升1,2,3
(1.中国科学院信息工程研究所,北京 100093;2.国家计算机网络应急技术处理协调中心,北京 100029;3.中国科学院大学,北京100049;4.北京邮电大学信息与通信工程学院,北京 100876)
为了建立用户精准兴趣模型以有效发现具有相似兴趣的用户群,提出了一种针对微博的短文本特征计算方法用于聚类算法,提升聚类效果以更好地挖掘微博用户的相似兴趣集合。该方法融合了微博转发数、评论数、点赞数等多个关键指标来度量微博短文本特征的重要性。同时,引入层次分析技术,改进了传统的tf-idf特征计算方法,并利用经典文本聚类算法进行实验。实验结果表明,改进后的短文本特征计算方法与传统的tf-idf特征计算方法相比,在类内集中度和类间分散度上取得了更好的效果。
层次分析;特征计算;文本聚类;短文本
1 引言
近年来,快速发展的社交网络已成为人们交流信息的重要平台。其中,微博作为主流社交平台之一,吸引了越来越多的网民参与其中。随着微博用户规模的迅速膨胀,微博平台上产生和流动的大量数据(如朋友关系、用户发布的内容等)具有重要的研究意义和应用价值。其中,如何基于微博平台中的各种信息来辅助发现和定位广告目标用户群,进而提升微博营销服务和产品的有效性,已成为近年来的研究热点之一。……
登录APP查看全文
