微博文本处理研究综述
2012-06-29张剑峰夏云庆姚建民
中文信息学报 2012年4期
张剑峰,夏云庆,姚建民
(1.清华大学,北京 100084;2.苏州大学,江苏 苏州 215006)
1 微博文本的定义
随着互联网和通讯产业的快速发展,微博成为了又一个跨时代的产品。微博存在着一个很显著的特点,就是能非常迅速及时地将信息传递到每一个用户。
微博文本与正式文本有很多不同的地方。第一,微博最大的特点就是文本长度短。不同微博系统对微博文本的字数限制不尽相同,以新浪微博为例,限定一个微博文本的字数不多于140个字符,更多的微博文本只是一个句子甚至一个短语。这一特点给微博文本处理造成了严重的数据稀疏问题。
第二,微博文本的文法通常是非正式的,语言是口语化的。为了提高交流速度,微博文本中缩写和拼写错误很常见,还经常掺杂着一些新近流行的网络语言和表情符号。
例1: “原来酱紫我^_^”
例1中的“酱紫”,是“这样子”对应的网络用语,“我”是“哦”的错别字,“^_^”代表了微笑表情。这些特点会给微博文本理解带来很大困难。
第三,半结构化。除了文本内容,微博文本还包含一些元数据,例如,作者、发布时间、转发数量、收藏数量、评论等信息。
第四,微博文本通常是某对话线索(conversation thread)中的一个发言或回复。通常定义线索为满足对话特征的微博文本序列,线索的第一个发言称为首帖。首帖发布后,更多的发言以回复的方式产生,称为跟帖。微博系统保存了大量的微博文本线索(thread),每个线索又包含了多个微博文本。微博文本的这一特点实际上形成了充足的上下文,给微博文本理解带来重要依据。……
登录APP查看全文
