基于Spark的大数据清洗框架设计与实现
2021-08-16张菁楠
科学技术创新 2021年22期
张菁楠
(天津轻工职业技术学院,天津 300000)
大数据是目前学术和企业重点关注的问题,是指利用收集到的复杂数据信息从而创造出较为显著的商业价值,充分的挖掘信息的潜在价值。一般来说,在大数据处理的过程中主要包含四个环节,数据采集--数据清洗--数据储存--数据分析。数据清洗在大数据处理中起着非常关键的作用,随着信息时代的到来,大量信息和海量数据引起了人们广泛的关注,也由此加强了对数据清洗的深度研究和分析。传统的数据清洗方法已经难以适应现代数据技术的发展,由此文章提出基于Spark的大数据清洗框架,通过组合和串联的方式来完成数据清洗的过程,并实现数据清洗的优化。
1 Spark——ETL大数据清洗框架
1.1 框架介绍
Spark——ETL技术框架的核心是为了解决大数据清洗问题。即大数据清洗系统内包含多个大数据清洗操作单元,在数据清洗的过程中通过不同清洗单元的组合形成一套完成的清洗流水线,从而开展清洗工作。在Spark--ETL系统中清洗单元具有一定的独立性,通过RDD的作用促进单元之间的联系,实现数据信息的共享和传递,而单元的主要作用体现在原始数据从获取到清洁直至存入大数据库的过程。在大数据清洗流水线运行的过程中也包含多个步骤,如提取、转化等等,在这些步骤当中包含以上或以上的大数据清晰操作单元。
Spark-ETL技术框架具有以下几个方面的特征:
第一,高性能处理。Spark-ETL技术框架是以RDD为数据封装对象,利用Spark的分布式计算能力实现数据清晰的系统,其性能较为高效。……
登录APP查看全文
