基于自适应免疫进化算法的聚焦爬虫搜索策略
2012-03-13刘丽杰许楠李盼池
黑龙江八一农垦大学学报 2012年4期
刘丽杰,许楠,李盼池
(1.黑龙江八一农垦大学信息技术学院,大庆163319;2.东北石油大学计算机与信息技术学院)
随着网络信息资源的急剧增长,越来越多的信息涌到人们的面前,而同用搜索引擎已经不能满足人们对个性化信息检索服务日益增长的需要。针对这种状况,近年来,人们提出了对某一特定领域的主题型搜索引擎,它可以提供分类更细致精确、数据更全面深入、更新更及时的因特网搜索服务[1],同时在指定的领域取得比综合型搜索引擎更满意的结果。而聚焦爬虫是专为查询某一领域或主题信息而出现的网页抓取工具,与通用网络爬虫不同,聚焦爬虫旨在抓取与某一特定主题内容相关的网页。因此,在搜索过程中无须追求最大覆盖率,对整个网络进行遍历,只需选择与主题相关的网页进行访问。目前主要使用的聚焦爬虫搜索策略[2]有:基于内容评价的搜索策略和基于链接结构评价的搜索策略[3]。
基于内容评价的策略以De Bra、Herseovici等人的研究Fish及Shark[4]为代表,最近的研究表明,这类网络蜘蛛在距离相关页面集较近的地方搜索时表现出良好的性能。但由于页面中的文本信息缺乏“全局性”,很难反映Web的整体情况,而且它忽略了链接结构信息,在预测链接价值的准确性方面存在不足。而以PageRank为代表的基于Web链接结构的搜索策略,则通过分析Web页面之间的相互引用来决定网页的重要性,从而决定链接的访问顺序,这类搜索策略的优点是考虑了链接的结构特征,但它忽略了页面与主题的相关性,在某些情况下,会出现搜索偏离主题的“主题漂移”问题,同时它的计算量也相当大,严重影响了爬虫的爬行速度,因此不适合发现主题资源。……
登录APP查看全文
