APP下载

基于层次分析的微博短文本特征计算方法

2016-06-21邹学强包秀国黄晓军马宏远袁庆升

通信学报 2016年12期
关键词:特征文本用户

邹学强,包秀国,黄晓军,马宏远,袁庆升

(1.中国科学院信息工程研究所,北京 100093;2.国家计算机网络应急技术处理协调中心,北京 100029;3.中国科学院大学,北京100049;4.北京邮电大学信息与通信工程学院,北京 100876)

基于层次分析的微博短文本特征计算方法

邹学强1,2,3,包秀国2,黄晓军4,马宏远2,袁庆升1,2,3

(1.中国科学院信息工程研究所,北京 100093;2.国家计算机网络应急技术处理协调中心,北京 100029;3.中国科学院大学,北京100049;4.北京邮电大学信息与通信工程学院,北京 100876)

为了建立用户精准兴趣模型以有效发现具有相似兴趣的用户群,提出了一种针对微博的短文本特征计算方法用于聚类算法,提升聚类效果以更好地挖掘微博用户的相似兴趣集合。该方法融合了微博转发数、评论数、点赞数等多个关键指标来度量微博短文本特征的重要性。同时,引入层次分析技术,改进了传统的tf-idf特征计算方法,并利用经典文本聚类算法进行实验。实验结果表明,改进后的短文本特征计算方法与传统的tf-idf特征计算方法相比,在类内集中度和类间分散度上取得了更好的效果。

层次分析;特征计算;文本聚类;短文本

1 引言

近年来,快速发展的社交网络已成为人们交流信息的重要平台。其中,微博作为主流社交平台之一,吸引了越来越多的网民参与其中。随着微博用户规模的迅速膨胀,微博平台上产生和流动的大量数据(如朋友关系、用户发布的内容等)具有重要的研究意义和应用价值。其中,如何基于微博平台中的各种信息来辅助发现和定位广告目标用户群,进而提升微博营销服务和产品的有效性,已成为近年来的研究热点之一。……

登录APP查看全文

猜你喜欢

特征文本用户
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
关注用户
关注用户
关注用户
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何获取一亿海外用户
如何快速走进文本