APP下载

一种相关话题微博信息的筛选规则学习算法

2012-07-09刘盛华程学旗

中文信息学报 2012年5期
关键词:规则分类文本

莫 溢,刘盛华,刘 悦,程学旗

(中国科学院 计算技术研究所,北京 100190)

1 引言

随着Web2.0的发展和信息传播手段的进步,微博这种以短文本形式出现的信息得到了迅猛发展,逐渐成为一种社会新媒体。2011年上半年,我国微博用户数量从6 311万快速增长到1.95亿[1],Twitter的注册用户总数已经超过三亿。自2010年8月以来,相比于传统搜索引擎,人们更愿意在社会媒体上花更多时间,微博成为了人们日常生活不可缺少的部分,以及实时信息的重要获取媒介。微博中的博文或推文(Tweets),本文统一称为微博信息,包含了丰富多样的话题,涉及政治、经济、军事、金融、生活、娱乐等各个领域。微博信息的实时性和时效性,给人们的生活带来便利的同时,也因其更新的速度远远地超越了人们的利用效率。以新浪微博为例,一般当关注人数超过几百以后,用户浏览信息的速度已经赶不上信息产生的速度。此外,随着移动智能终端技术的不断发展,人们更愿意在移动终端上使用社会媒体。而移动终端每次浏览信息更少,因此从大量微博信息中根据所有用户感兴趣的话题即时筛选,越来越引起学术界和工业界的广泛关注。TREC 2011新增的微博任务,就将给定话题的微博信息筛选列入了其备选任务之一。

如何根据给定话题筛选微博信息,可以借助于文本分类的技术。针对传统长篇文档分类的研究取得了长足的发展,并已经广泛应用于业界。然而由于微博信息篇幅极短、包含的信息和特征少等特点,传统的文本分类技术不再适用,尚没有成熟的理论和技术。……

登录APP查看全文

猜你喜欢

规则分类文本
撑竿跳规则的制定
数独的规则和演变
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
让规则不规则
教你一招:数的分类
TPP反腐败规则对我国的启示
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本