基于集群的分布式爬虫系统的架构研究
2021-03-08和乾
科学与财富 2021年3期


摘 要:互联网时代,如何从海量数据中收集信息是一个关键问题。目前,使用最频繁的信息检索与收集工具是基于通用爬虫的搜索引擎。与通用爬虫相比,主题爬虫尽量避免与主题不相关页面的抓取,存储的页面数量更少,所获取的信息价值密度更高,是一种有效的信息收集工具。如何通过有效的架构设计降低爬虫任务的耗时是一个关键问题。
关键词:主题爬虫;架构;Scrapy
网络爬虫指的就是一种根据既定规则对Web网页中应用程序或脚本进行自动提取的技术。如今,各大搜索引擎网站和大型互联网企业均在大幅使用此类爬虫程序,爬取目标网站的网页信息,以实时更新企业内部服务器关于这类信息的内容。网络爬虫的步骤流程一般可分为采集数据,分析或转换数据,存储数据三个部分。在传统爬虫中,首先给定一个或者多个URL,爬虫程序开始运行,从给定的URL上获取网页的信息,分析过滤新获取的URL,存入等待爬取的URL数据库表中,不断重复此过程。
单机版本的网络爬虫存在很明显的缺陷,受限于单独的主机配置,不能任意扩展性能,在生产环境中极少使用。因此,目前网络爬虫一般均会使用分布式爬虫架构,可以在多个节点同时运行,大幅提高了爬虫速度和效率。对于分布式爬虫架构,常见的有主从式、对等式、混合式架构。
1 主从式架构
在主从分布式结构中,一般只有一个主节点,其余均为从节点。主节点负责URL的存储与分发,其它节点则进行网页的爬取下载工作。……
登录APP查看全文
