面向新浪微博的故事脉络生成系统
2021-12-20王崇伟赵旭剑
王崇伟 赵旭剑
(西南科技大学计算机科学与技术学院 四川绵阳 621010)
近年来,社交网络作为一种新型媒体迅速发展,其中代表性平台新浪微博成为了人们发现事件、传播事件的主要平台。与之对应的是爆炸式的微博量增长[1],这些数据带来了丰富的社会事件信息,也让用户难以从中发现感兴趣的事件。因此,从海量的微博数据中检测事件、构建故事脉络,可让用户清晰准确地了解事件的发展全貌。
为了推动故事脉络挖掘工作的研究,一些知名国际会议也逐渐出现了类似任务,如:TAC(Text Analysis Conference)从2014年开始有了事件追踪任务[2],ACL(Annual Meeting of the Association for Computational Linguistics)在2017年举办了第一届“新闻中的事件与故事”研讨会[3]。对于一些影响强烈的事件,百度百科、维基百科等网络百科全书也会构建一条故事记录,以展示事件的起因、经过和结果。可以看到,故事脉络构建在文本挖掘和信息挖掘领域越来越受关注。
目前,故事脉络生成的相关研究可分为以下三类:
(1)基于聚类算法利用相似度将事件聚类到不同的演化分支以构建故事脉络。例如Liu等[4]基于聚类提出合并、扩展、插入3种事件操作实现故事脉络生成;Hawwash等[5]把微博训练成事件向量,输入事件向量对事件进行聚类生成故事脉络。
(2)基于贝叶斯模型把故事脉络建模为事件特征的联合分布,然后推断链接事件。例如佘玉轩等[6]利用贝叶斯模型把故事脉络建模为日期、时间、机构、人物、地点、主题及关键词的联合分布。Zhou等一步步对贝叶斯模型改善,提出无监督贝叶斯模型[7]、动态故事脉络抽取模型[8]和第二代动态故事脉络抽取模型[9],得到更加完善的故事脉络。……
