基于Wikidata和标签云的搜索算法研究
2017-03-31夏瑀葛佳琦马秀曹际全李海巍
软件导刊 2016年8期
夏瑀+葛佳琦+马秀+曹际全+李海巍



摘 要:知識库是一种结构化、易于操作、有组织的知识集群。针对Wikidata这一开放知识库的内容及结构,提出一种构建标签云的方法,对信息进行标签化处理,并将转换得到的标签向量应用于信息检索和页面排序。首先,提取Wikidata中的结构化数据,构建以实体为单位的标签云;然后,将需要检索的文档和用户的检索语句映射为相应的标签,并采用处理向量的相关方法实现网页的排序算法;最后,采用信息检索常用的标准对该算法进行验证。实验结果表明,与传统的基于关键词的搜索方法相比,新算法在一定程度上能够提高页面排序的准确率。
关键词关键词:知识库; Wikidata; 网页检索; 页面排序; 标签云; 搜索引擎
DOIDOI:10.11907/rjdk.161447
中图分类号:TP312
文献标识码:A 文章编号:1672-7800(2016)008-0042-04
0 引言
信息呈现几何式爆炸增长,面对如此庞大的信息数量,搜索引擎成为互联网的绝佳入口。目前主流的搜索引擎算法仍以关键词的匹配程度检索,但是相同的词语在不同的语境中有着不同的意义,而不同的人对同样的词语也会有不同的理解, 因此简单地基于关键词的搜索引擎既不能识别出关键词的意义,亦不能从语义的角度进行结果排序。在网页排序算法方面,诸如著名的PageRank[1]、HITS[2]以及结合前两者的SALSA[3]算法都是根据网页间链接的关系进行排序的。 如果仅考虑网页间的链接结构来分析页面的权威性,就容易忽视页面的具体内容并且剥离搜索语句和最终搜索结果之间的联系,从而影响搜索的查全率和查准率。……
登录APP查看全文
