APP下载

基于Scrapy爬虫框架下电商数据分析

2021-11-07黄雨辰

安阳师范学院学报 2021年5期
关键词:数据处理页面可视化

黄雨辰,童 彤

(1.徽商职业学院,安徽 合肥 230000;2.马鞍山学院,安徽 马鞍山 243100)

1 关键技术分析

1.1 Scrapy爬虫框架

Scrapy是由Python开发的快速、高层次屏幕抓取和Web抓取框架,能够从抓取的页面中提取结构化的数据,在数据挖掘、检测中具有广泛的应用。Scrapy是一个爬虫框架,使用者可以结合需要进行修改,提供了不同类型的爬虫基类,如BaseSpider、Sitemap爬虫、Web2.0爬虫等[3]。Scrapy爬虫框架具有三个方面的优点:首先,Scrapy功能强大、运行速度快、使用方便,框架设计者只需要将爬虫规则增加到代码中就可以自动实现对相关数据的抓取操作。其次,Scrapy具有非常强的扩展性,设计者在使用Scrapy爬虫时无法接触其他的核心代码。最后,Scrapy是一种跨平台的框架,能够在不同的操作平台上使用[4]。

Scrapy新版本增加了许多旧版本所没有的新功能,如新版本的Scrapy能够对spider中返回字典类型数据进行支持,对spider进行个性化设定,清除原有日志模块,将其转换为Python中的原生logging模块。此外,新版本的Scrapy还可以对crawler API进行重新建立,使得crawler API变得更加简洁。Scrapy爬虫框架组件构成如图1所示。

图1 Scrapy爬虫框架组件构成

Scrapy爬虫框架程序如下:

1)Spider(爬虫)把等待抓取URL(链接)网页通过Scrapy Engine(引擎)传递给Scheuler(调度器);

2)经调度器相关处理结束之后,再由引擎与Downloader Middl eware(下载中间件)传递于Downloader(下载器);

3)下载器向互联网发出相关请求,接收Response(应答包),再把应答包通过引擎与Scrapy Middelwares(Scrapy中间件)传递给爬虫;

4)爬虫对应答包进行处理提取之后,再由引擎传递于Pipeline(项目管道)进行储存;

5)对链接进行提取,再重复以上整个操作流程,坚持至没有链接请求或者满足其停止条件。……

登录APP查看全文

猜你喜欢

数据处理页面可视化
大狗熊在睡觉
刷新生活的页面
基于CiteSpace的足三里穴研究可视化分析
认知诊断缺失数据处理方法的比较:零替换、多重插补与极大似然估计法*
基于Power BI的油田注水运行动态分析与可视化展示
ILWT-EEMD数据处理的ELM滚动轴承故障诊断
基于CGAL和OpenGL的海底地形三维可视化
“融评”:党媒评论的可视化创新
基于希尔伯特- 黄变换的去噪法在外测数据处理中的应用
基于POS AV610与PPP的车辆导航数据处理