基于Hadoop集群的大数据新闻可视化平台的设计
2021-06-16王一高任耀星李嘉瑶
电子技术与软件工程 2021年7期
王一高 任耀星 李嘉瑶
(山西农业大学 山西省晋中市 030801)
随着智能推荐系统的不断发展和完善,智能推荐算法在各种软件中得到了应用。智能推荐算法在让人们毫不费力地浏览到自己关心的事物同时给软件运营商带来收益,但是长此以往,人们的视野逐渐变窄,眼里的世界不再那么丰富多彩,不能全方位了解和分析客观事物。因此本文设计了一种全新的新闻可视化平台,该平台的目的就在于帮助人们摆脱智能推荐算法,可以快速地按热词来浏览相关新闻,用最短的时间获取到最多的信息。
1 系统设计
本文所设计的大数据新闻可视化平台的系统架构图见图1。一般情况下,大数据的处理由数据采集、数据预处理、数据存储、数据分析与挖掘、数据可视化这五部分构成。本文所设计的大数据新闻可视化平台依赖于Hadoop 集群实现:数据采集部分使用分布式多进程网络爬虫采集互联网主流新闻媒体的热榜数据;之后在爬虫内部进行数据预处理,筛选或删除掉一些不规则的数据;数据存储部分使用HDFS 存储离线数据,使用MySQL 存储实时处理结果;数据分析部分分为实时数据分析和离线数据分析,通过SparkStreaming 进行实时流数据处理,通过MySQL 或HiveSQL 进行离线数据分析,其中MySQL 的数据分析结果用于数据可视化,HiveSQL 则用于海量离线数据分析。
2 系统实现
2.1 Hadoop高可用集群部署
由于单个NamNode 节点存在单点故障且面对海量数据存在压力过大的问题,一旦该节点发生宕机,整个集群都会不可用[1]。……
登录APP查看全文
