APP下载

网络爬虫针对“反爬”网站的爬取策略研究

2016-05-19邹科文李达邓婷敏李嘉振

电脑知识与技术 2016年7期
关键词:搜索引擎

邹科文++李达++邓婷敏++李嘉振++陈义明

摘要:随着计算机技术和internet的迅猛发展,信息和知识呈现爆炸性的增长,如何获取和利用信息成为现代社会提高竞争力的重要途径,网络爬虫是达到这一途径的重要工具。该文详细阐述了网络爬虫的体系结构、工作原理和URL搜索策略,针对某些网站采用的“反爬”措施,提出了几种爬取策略,以实现网页的有效爬取。对实际网络爬虫获取信息具有重要的参考价值。

关键词:网络爬虫;反爬虫机制;搜索引擎

中图分类号:TP393 文献标识码:A 文章编号:1009-3044(2016)07-0061-03

信息和知识爆炸增长的时代,搜索引擎成为人们获取信息的重要工具。搜索引擎释放出来的网络爬虫会大量占用互联网带宽,很可能在短时间内导致网站访问速度缓慢,甚至无法访问。应对此种情况,许多网站采取了一些措施来拦截网络爬虫的爬取。本文在分析网络爬虫原理的基础上,针对“反爬”网站提出了一些有效的爬取策略。

1网络爬虫概述

网络爬虫是抓取网页信息的一种程序,它可用来检查一系列站点的有效性,当按照需求抓取并保存数据时,是搜索引擎的重要组成部分。它还可以定向采集某些网站下的特定信息,比如招聘、二手买卖等信息。

网络上的网页许多都由超链接连接,故形成了一张网,网络爬虫因此也叫做网络蜘蛛,顺着网爬,每到一个网页就抓取信息并抽取新的超链接,用于进一步爬行的线索。网络爬虫爬行的起点叫做种子,可以自己设定也可以从某些系列网站获取。……

登录APP查看全文

猜你喜欢

搜索引擎
Chrome 99 Canary恢复可移除预置搜索引擎选项
网络搜索引擎亟待规范
Nutch搜索引擎在网络舆情管控中的应用
广告主与搜索引擎的双向博弈分析
基于Lucene搜索引擎的研究
知识漫画
一种自反馈式元搜索系统的设计
搜索引擎,不止有百度与谷歌
搜索,也要“深搜熟滤”
浅析搜索引擎的原理及发展前景