基于时间感知的页面排序算法的改进
2017-03-21,,,,,
中华医学图书情报杂志 2017年1期
,, ,,,
互联网网页的信息大多都具有时效性,而搜索引擎在处理具有时间属性的查询还存在一定的问题[1-3]。比如,2016年10月,在百度中输入“十大电影排名”时,首先出现的是近期上映的电影,然后才出现近年的“十大电影排名”搜索结果,前几条记录均是2015年、2014年发布的消息,2016年发布的消息则排到第6条记录。搜索引擎并不能对用户查询信息时间敏感性的要求对信息进行加工与处理[4],显然结果不能让用户满意。于是利用时间感知对信息搜索结果进行排序的研究显得很有必要。
1 国内外时间感知页面排序算法的研究
有关时间感知的查询,目前已有部分学者进行了相关研究。ShengLin[5]等人提出了一个关于时间感知的页面排序算法,用一个四元的方式来表示文档的时间,通过页面时间与查询时间之间的比较,获得两时间之间的相似度,从而获得基于时间感知的页面排序算法。他们运用了6 455 985组数据进行实验,其中含有显式时间的数据有3 763 923组(占58%),隐式时间的数据有2 692 062组(占42%),实验结果显示,查询的精确度较没有运用此算法之前至多提高了15.13%。在国内,在张乃洲等人[6]也研发出了一种基于时间感知的搜索引擎模型[3]。该模型主要分为页面时间属性抽取器、时间感知查询处理模块、基于时间感知的页面排序模块三大部分,其中运用到时间粒度来对页面与查询间的时间相关度进行计算,最后通过时间感知度因子权衡得出结果页面的排序算法。在页面时间属性抽取部分,对于含显式时间的页面其抽取精度可达0.93,然而对于隐式时间的页面抽取精度仅为0.76。……
登录APP查看全文
