联合贝叶斯推理与遗传算法的主题信息搜索策略
2014-08-06张小琴
中南民族大学学报(自然科学版) 2014年2期
张小琴
(中南民族大学 图书馆,武汉 430074)
随着大数据时代的到来,快速、准确的高性能搜索引擎是下一代互联网面临的挑战之一[1].主题信息搜索引擎专注于特定主题,更新速度快,且能够提供给用户更专业更人性化的检索结果,已成为研究的热点.在主题信息搜索系统中,搜索策略是影响系统性能的关键,常用的主题搜索策略有:基于网页链接结构的搜索策略和基于内容评价的搜索策略.其中,PageRank[2]和Hits[3]是基于链接结构的搜索策略.Fish算法[4]和Shark算法[5]是基于内容评价的搜索策略.这些搜索策略存在主题漂移现象,以及在预测网页的重要程度方面存在不足等问题.
基于此,本文在目前常用的主题爬虫Heritrix[6]框架基础上,将贝叶斯推理与遗传算法相结合改进其搜索策略.通过在搜索的初始阶段引入高质量的种子集合,搜索过程中结合Hub网页对主题的贡献,利用贝叶斯推理对于网页主题进行判断,并结合遗传算法对搜索过程进行启发式引导.在提高网页搜索质量的同时扩大搜索范围.
1 系统模型
主题信息检索从初始的URL集合开始,提取链接主题信息,判断网页是否与主题相关,如果与主题相关,就保存网页并为其构建索引.反之,则抛弃网页.系统模型如图1所示.

图1 系统模型Fig.1 System model
主题信息搜索过程包含以下几个步骤:(1)选择生成初始URL集合;(2)从URL集合中取出URL,并提取URL所对应的页面;(3)分析页面,提取页面所包含的所有URL链接,判断是否访问后加入URL集合中;(4)分析主题相关度,主题相关则保存页面并建立索引,反之抛弃;……
登录APP查看全文