APP下载

基于Python的图书网爬虫设计与实现

2021-11-28孙泽龙

电子制作 2021年20期
关键词:进程页面信息

孙泽龙

(西安职业技术学院,陕西西安,710077)

1 图书网爬虫的特点

由于现在绝大多数图书网站都是基于一定的模板开发的,使用相关的模板,可以快速完成相同版式且不同内容的大量页面,通过这个规律只要把相同的内容都获取下来,求同存异地获取实现大量页面的目的[1]。

Python实现网络爬虫需要手动安装第三方库。Python爬虫需要HTTP请求,它可以理解为是从客户端到服务器端的请求消息。即就是说,无论是真正的一个人在操作浏览器还是一个爬虫,当希望从服务器请求信息或服务时,首先就需要向服务器端发出一个请求,进而服务器会返回相应响应,最后连接关闭,Web服务的流程就是这样完成的。本文用到的库函数包含requests库,使用requests库调用get()和set()两种提交方法获取图书网站源码,如果网址需要提交的内容是JSON格式,要进行调用修改post()方法的一些参数。编码格式用很多种,通过相关图书网站编码的测试,大多数情况下使用”utf-8”可以进行中文正常显示。单网络爬虫是只有一个线程和进程,每次爬取访问一个页面,为了提高爬取效率和充分使用计算机网络带宽,一次同时让爬虫访问多个页面的目的,将使用多进程技术,通过调用multiprocessing多进程库,处理多进程的相关操作。因为爬虫属于读写操作密集型的事情,当我们访问请求网页相关源码时,多线程省去了大量等待返回网页的时间[2]。当然,对于访问数量达到一定数量级时,多线程需要通过异步操作来保持自身爬虫运行的效率。……

登录APP查看全文

猜你喜欢

进程页面信息
大狗熊在睡觉
刷新生活的页面
债券市场对外开放的进程与展望
订阅信息
展会信息
社会进程中的新闻学探寻
我国高等教育改革进程与反思
Linux僵死进程的产生与避免
同一Word文档 纵横页面并存
浅析ASP.NET页面导航技术