基于Spark的分布式大数据分析建模系统的设计与实现
2018-10-24徐时芳罗晓宾陈阳华
徐时芳 罗晓宾 陈阳华
摘 要: 针对分布式大数据对数据存储、清洗、转化、聚合、挖掘和分析工作所造成的挑战,设计并实现了一种基于Spark的分布式大数据分析建模系统。该系统通过数据采集、数据存储、数据分析、数据管理和数据应用5个模块,实现结构化、半结构化及非结构化数据的适配采集与离线、在线分析处理;并使用管理和控制平台,实现系统的协调运行。软硬件实现及建模测试结果表明,所提出的系统能实现具体场景故障诊断数据的有效、精确聚类,并可满足大数据处理的速度和精度需求。
关键词: 分布式大数据; Spark; 数据分析; 数据建模; 非结构化数据; 故障诊断
中图分类号: TN919?34; TM76 文献标识码: A 文章编号: 1004?373X(2018)20?0172?03
Abstract: In allusion to the challenges posed by distributed big data to data storage, cleaning, transformation, aggregation, mining and analysis, a distributed big data analysis and modeling system based on Spark was designed and implemented. In the system, adaptive acquisition, offline analysis processing and online analysis processing of structured, semi?structured and unstructured data are realized by using five modules of data acquisition module, data storage module, data analysis module, data managemetn module and data application module. The management and control platform is used to achieve coordinated operation of the system. The results of software and hardware implementation and modeling test show that the proposed system can achieve effective and accurate data clustering for fault diagnosis of specific scenarios and meet the speed and accuracy requirements of big data processing.
Keywords: distributed big data; Spark; data analysis; data modeling; unstructured data; fault diagnosis
0 引 言
隨着互联网的快速发展,产生了大量复杂多变的结构化、半结构化和非结构化数据[1],对数据存储、清洗、转化、聚合、挖掘及分析工作造成了极大的挑战[2?5]。虽然现有的分布式存储技术能将海量数据存储在服务器集群中[6],但大数据存在结构复杂、格式不统一、不规范的问题,需要去除其中的“糟粕”,以提取出有价值的数据[7];同时,随着数据量呈指数的方式增长,需要更高效的算法和工具来合理分配计算资源[8]。现有的数据处理方式难以实现异构数据的处理。因此,本文借助Spark数据分析技术[9]构建大数据分析建模系统,以提高分布式大数据处理的效率与精度。Spark是加州伯克利分校AMPLab实验室于2009年提出的MapReduce分布式计算的替代方案,具有速度快、通用性和易用性强等特点[10]。……
