面向领域的高质量微博用户发现
2018-08-17叶永君周美林万仪方
中文信息学报 2018年7期
叶永君,李 鹏,周美林,万仪方,王 斌
(1. 中国科学院 信息工程研究所,北京 100093;2. 中国科学院大学,北京 100049)
0 引言
随着信息化进程不断加快,越来越多的普通用户从信息的阅读者演变成了信息的创造者与信息的传播者。其中,微博平台已经成了一个产生热点事件和观察社会言论的重要场所。据估计,Twitter平台每天有高达五亿条微博消息被人们所发布。 这些微博消息主题丰富,既包含一些普通对话,也包含特定领域相关的有价值信息。根据微博系统的功能规则,人们(follower)必须关注其他用户(followee)才能获取信息,这些被关注用户(followee)发布的信息质量完全决定了关注者(follower)所获取信息的价值。考虑到用户价值往往集中在特定领域,选择领域相关的高质量用户[1]进行关注,对于微博使用者进行信息获取具有重要价值: 一方面可以获取更全面的信息(相关信息),另一方面也可以减轻信息(不相关信息)过载问题。
本文将高质量微博用户发现问题拆解成两个子任务: 领域相关用户的检索任务以及用户质量排序任务。领域相关用户检索任务是给定领域,从海量微博用户中找到与该领域相关的用户;用户排序任务是指给定用户集合,根据用户质量对用户进行排序。
在具体方法上,对于领域相关用户检索任务,我们尝试将领域词与微博用户的匹配转化为领域词和用户标签的匹配。其中,为了解决词项失配问题,我们使用了基于维基百科的语义相似度计算方案。该方法首先将领域词、标签词表示为维基百科的词条向量,基于词条向量来计算匹配度。……
登录APP查看全文
