基于网络爬虫的数据可视化系统设计与实现
2021-09-23乔士秀圣文顺
电子技术与软件工程 2021年12期
乔士秀 圣文顺
(1.德州市市场监督管理局 山东省德州市 253500 2.南京工业大学浦江学院 江苏省南京市 211200)
进入21世纪,数据成为人类最宝贵的财富。如今,中国网民数量已经达到9亿之多。随意挑选一款互联网产品,可能就有几亿的用户。如何将数据有效地检索并组织呈现出来,有着巨大的应用前景。
面对庞大的数据量,如何有效的检索,并且直观的展示,就显得尤为重要。当今人们检索数据有两种方式。使用搜索引擎是最普遍的一种。搜索引擎的出现大大降低了人们获取数据的难度,人们可以轻松地通过检索关键字获得所需的数据。但是这种通用型爬虫缺点也是非常明显的,即无法获得特定的数据。最具有代表意义的就是每个网站的robots.txt文件,此文件可以要求通用型搜索引擎哪些资源不能被爬取。部分网站甚至所有内容都禁止爬取。用户就无法通过搜索引擎获取到这些信息。而另一种检索工具是主题网络爬虫[1],优势就显得非常明显。开发者首先分析目标网站的网页结构以及API信息,根据这些信息爬取所有需要的数据。之后使用数据处理的相关技术,提取出有价值的数据,最终通过可视化技术把数据直观的展现出来。由此带来了极大的便利。不同领域、不同背景的用户往往具有不同的检索目的和需求,通过主题爬虫,就能完美定制这些个性化服务。
1 系统需求分析
网络数据爬取及展现系统是对bilibili网站各项数据可视化的平台。爬虫设置定时任务,每天根据配置自动抓取目标信息,并对数据进行处理,然后持久化到MySQL数据库。……
登录APP查看全文
