通用语料的眼动数据对微博关键词抽取的性能提升探究
2021-05-26章成志胡少虎张颖怡
情报学报 2021年4期
章成志,胡少虎,张颖怡
(南京理工大学经济管理学院信息管理系,南京210094)
1 引言
关键词通常为描述文档的主题信息的词语[1]。随着信息资源的快速增长,人工标注文本关键词的方式已经无法满足实际需求。因此,关键词自动抽取研究逐渐引起了学术界的重视。此外,关键词抽取可以作为文本摘要、文本聚类、文本分类等任务的基础。
在线社交媒体是网民发表个人见解、分享个人状态的重要载体。在线社交媒体每天产生海量的用户生成内容(user generated content,UGC)。如何高效地组织用户生成内容已成为业界与学术界共同关注的问题。从海量的用户生成内容中及时有效地抽取关键词,对于在线社交网络的信息组织尤为关键。因此,许多关键词抽取研究选择微博语料作为研究对象,本文的研究同样将在推特语料上开展。
目前,机器学习方法被广泛应用于关键词抽取任务。具体来说,基于机器学习的关键词抽取研究可以分为非监督的抽取方法与有监督的抽取方法[2]。关键词抽取结果的评估,一般都以关键词标注数据作为依据。标注员在标注关键词时,首先阅读待标注文档的全文,然后根据理解标识出有代表性的若干词语。已有研究表明,当人们在阅读文档的时候,对于文本中的所有单词的关注程度并不均等[3]。这说明人们在阅读时的注意力并非均匀地分布在每一个单词上,读者更有可能将注意力集中在有助于其理解文本含义的词汇上。根据这一观察,研究者可以度量阅读者对不同单词上的注意力强弱,并将该信息用于关键词抽取,提升抽取的性能[4]。……
登录APP查看全文
