基于XPath的天气数据的爬取研究
2021-11-17史雅婷梁洪炎吉卓嘎强巴卓玛
江苏通信 2021年5期
王 康 史雅婷 梁洪炎 吉卓嘎 强巴卓玛
西藏民族大学信息工程学院
0 引言
在大数据时代,谁拥有了数据,谁就有更多的筹码。气象服务是这个时代必不可少的部分,人们每天的出行计划需要依靠今天的天气状况来定。气象部门每天通过手机、电视、报纸、广播、短信来告知人们今天的天气状况,以防范自然灾害等突发状况。截至2018年,全国共有661个市,每小时统计一次,在一天内就收集到了661×24=15 864条数据。
网络爬虫本质上是利用程序在网上搜集有用的数据,是一种按照一定的规则,自动抓取互联网信息的脚本。开发者可以随意地扩展各个组件,来实现抓取逻辑。网络爬虫能帮助人们快捷、方便地获取天气网特定城市近7天内的天气预报数据。
网络爬虫有很多类型,不同类型的爬虫适用于不同的场景,本文提到的爬虫为批量性爬虫,这种爬虫一般适用于用户明确自己想要的信息或者知道所需信息的网络结构位置。但在一些大数据或者超大数据的分析与处理中,一般要用增量型爬虫,其是一种没有明确限制的爬虫,信息量大且比较杂乱,需要用机器学习和深度学习对爬去的信息进行分析和处理,而且增量型爬虫容易被网站反爬虫程序检测。除此之外,还有深度网络爬虫等。
1 XPath及其应用
XPath是在XML文档中查找信息的一种语言,用于在XML文档中通过元素和属性进行导航。XPath使用路径表达式来选取XML文档中的节点或节点集。XPath依赖于Python中的lxml第三方类包。……
登录APP查看全文
