基于51job网站招聘信息的爬取与分析
——以Python技术岗位为例
2021-04-24毛遂毛红霞
网络安全技术与应用 2021年4期
◆毛遂 毛红霞
(四川大学锦城学院 计算机与软件学院 四川 611731)
1 背景
伴随着社会便利性科技的不断发展和大数据相关技术的普及与应用,大多数人由前往人才市场的传统招聘转变为在相关招聘网查看和筛选合适岗位。网络招聘不但招聘范围广、招聘信息齐全,而且招聘方式更为便捷。它打破了时间和地域的限制,逐渐成为企业组织招聘的主流方式之一[1]。但因为大量相关信息的充斥和地域空间的限制,很多的招聘者难以在短时间内找出适合自己的岗位和工作地点。
网络爬虫技术的不断发展刚好为这样繁杂的数据找到了一条很好的处理道路,利用web 网络爬虫技术可以将大量的招聘信息保存到本地,再结合Python 语句就可以实现数据的清洗整合和图例绘制。
2 相关技术分析
2.1 爬取技术分析
网络爬虫(Web Crawler),是一种按照一定的规则,自动提取Web网页的应用程序或者脚本,工作原理是基于http 协议中请求与响应机制。其优点在于,它可以将整个网页的源代码完整爬取下来[2]。访问者通过相关设备发送请求并传输url 到目标服务器,目标服务器通过相关处理和优化分析后返回访问者所需信息,访问者得到相关HTML 信息后可利用Beautiful Soup,正则表达式,Xpath 等技术去获取到想要的网页固定信息。此外本次实验将通过引入selenium,time等包进行网页的动态爬取。
2.2 数据清洗和可视化技术分析
Python 这门语言为技术者们提供了大量的数据处理的方式,常用的有pandas 以及matplotlib。Pandas 是用于高性能数据分析的技术库,在支持各种数据结构相互转换的同时又可提取和保存数据。……
登录APP查看全文
