基于维基百科的语义相关度算法研究综述
2015-09-21景雪芹徐建良
网络安全与数据管理 2015年14期
景雪芹,徐建良
(中国海洋大学 信息科学与工程学院,山东 青岛 266100)
0 引言
相关度是指事物之间相关联的程度,而语义相关度是指概念之间相关联的程度。计算语义相关度是非常复杂的,因为它需要用到丰富的语义知识,也要对不同的关系给出不同的权重值。在语义信息处理的相关研究中,很多研究者利用语料库的相关统计信息获取语义相关度信息,也有研究者利用WordNet等语义网络来衡量词或者概念之间的语义相关度。近年来,很多研究都证明维基百科是计算语义相关度的一个好资源。
最先利用维基百科进行语义相关度研究的是STRUBLE M和 PONZETTO S P[1],他们把应用在 Word-Net上效果比较好的一些经典算法应用到维基百科中,实验结果表明,在大数据集上,在维基百科的效果要好于在 WordNet的效果。随后,ZESCH J和 GUREVYC I[2]对维基百科的分类图和文档图进行了图论分析并与GermaNet进行了比较,同样证明了维基百科可以作为一种语义知识资源代替一些传统的语义网络,将自然语言处理的一些经典算法应用到维基百科中是可行的。
本文对维基百科进行了研究,对利用维基百科计算语义相关度的算法进行了调研,最后总结了几种典型算法的特点并进行了分类。
1 维基百科
维基百科于2001年被发起,现在,它涵盖了艺术、地理、历史、自然科学等领域,包括了200多种语言的版本,注册用户达5000多万。它作为互联网上最大的最广泛使用的免费的百科全书,拥有超过百万的解释页面,更新速度快。……
登录APP查看全文
