APP下载

分布式网络爬虫设计

2017-10-13郭丙琴陈爱武

湖南科技学院学报 2017年6期
关键词:页面信息设计

郭丙琴陈爱武



分布式网络爬虫设计

郭丙琴1陈爱武2

(1.湖南科技学院 教学质量管理处,湖南 永州 425199;2.湖南科技学院 电子与信息工程学院,湖南 永州 425199)

网络爬虫是互联网信息获取的重要工具之一,其性能的好坏直接影响到互联网信息检索的准确性,互联网信息复杂多变,造成传统方法的网络爬虫容易抓取到错误信息。论文在此基础上提出了一种并行和分布式技术进行设计,并通过招聘网页信息抓取的实验,实验结果证明该网络爬虫性能稳定,可以提升抓取信息的准确性。

分布式;网络爬虫;Python;搜索引擎

1 引 言

搜索引擎是基于一种网络爬虫技术来抓取Web网页、文档、图片、音频、视频等信息,并通过索引来组织这些信息,设计性能优良的网络爬虫是搜索引擎重要工作之一[1]。网络爬虫始于一张被称作种子的统一资源地址(URLs)列表,当网络爬虫访问这些统一资源定位器时,它们会甄别出页面上所有的超链接,并将它们写入一张“待访列表”,即所谓“爬行疆域”(Crawl Frontier),此疆域上的统一资源地址将被按照一套策略循环访问。如果爬虫在执行的过程中复制归档和保存网站上的信息,这些档案通常储存,使它们可以被查看。网络爬虫只能在给定时间内下载有限数量的网页,所以设计大容量体积的网络爬虫时需要优先考虑其下载,而互联网资源瞬息万变,网络爬虫下载的网页在使用前就可能已经被修改甚至是删除了。另外,服务器端软件所生成的……

登录APP查看全文

猜你喜欢

页面信息设计
大狗熊在睡觉
刷新生活的页面
瞒天过海——仿生设计萌到家
设计秀
订阅信息
有种设计叫而专
展会信息
同一Word文档 纵横页面并存
浅析ASP.NET页面导航技术
设计之味