基于大数据的用户行为分析系统
2021-06-04丁鹏程
丁鹏程
(宁波大学信息科学与工程学院,浙江 宁波 315200)
1 大数据相关理论概述
1.1 Spark
Spark 技术可以实现对大数据的快速集群计算,其运行在Hadoop 集群上,能够对Hadoop 中的数据资源进行访问。基于Spark 技术,对数据进行处理和分析,可以支持多种文件格式,包括文本文件、SequenceFile、Avro 等。同时,Spark 的数据结构为RDD(弹性分布式数据集),该数据集在创建后不能修改[1]。应用Spark技术对数据进行处理,是创建RDD、转化RDD、调用RDD,并进行求值的过程。最终,RDD 中的数据会分布到集群中,实现并行化的操作执行。
1.2 Hadoop
Hadoop 技术是基于分布式服务器集群对数据进行运算和分析的框架。包括HDFS、MapReduce、Yarn 组件。基于本文主要研究内容,着重对MapReduce 组件进行介绍。首先,MapReduce 组件是一种数据处理的编程模型,分为:Map、Reduce 两个阶段[1]。
1.3 Clickhouse
Clickhouse 是一个列式数据库,建立该数据库的目的在于对数据进行快速的在线分析与处理[2]。Clickhouse数据库的优点包括:紧凑数据格式、数据压缩、数据存储在磁盘、多核处理、支持分布式、支持部分SQL、数据实时更新等。
2 系统架构设计
Spark(计算引擎)是一种具有通用性特征的,可以对大规模数据进行快速计算和处理的引擎。根据官方的数据信息显示,Spark 计算引擎的运算速度快于HadoopMapReduce 的运算速度100 倍[2]。并且Spark 计算引擎的运行模式具有多样化特征,主要包括:本地运行模式、独立集群运行模式等。本文采用Spark 的分布式集群系统平台架构,对用户的行为数据信息分析系统进行深度设计。该系统架构层次有四层,分别为:数据采集层、数据存储层、数据分析层、数据应用层。其中,数据存储层,可以分布式存储系统所采集到的数据与信息,通过虚拟技术的应用,实现数据信息的统一化管理;……
