基于Hive的空气质量大数据查询优化方法
2020-08-13刘黎志张晨跃
武汉工程大学学报 2020年4期
关键词:优化
彭 贝,刘黎志*,杨 敏,张晨跃
1.智能机器人湖北省重点实验室(武汉工程大学),湖北 武汉430205;
2.武汉工程大学计算机科学与工程学院,湖北 武汉430205
大数据技术对环境监测数据分析和综合决策具有重要意义。我国已建成涵盖国家、省、市、县4个层级的环境质量自动监测系统,建立了环境质量实时发布系统[1]。根据全国“互联网+监管”系统建设的总体设计,在省级设立一个数据监管中心,建立各类监管数据库。县、市级环境监测机构负责编制辖区内环境质量报告,上报省环境监测中心站。省环境监测中心站汇总分析各地报告并编制全省环境质量报告。因此,省级中心站收集了全省范围内各个自动化监测站的数据,其中的空气质量监测数据库收集记录了省内各站点的SO2,NO2,PM10,CO,O3,PM2.5六类污染物的每小时监测均值及相关气象参数等数据[2-3]。随着时间的推移,省级中心站存储的数据量越来越大,形成了有着容量大、种类多、产生速度快、价值高、密度低等特征的大数据[4-5]。在对这些大数据进行统计分析时,SQL Server等传统关系数据库会出现存储空间不足、数据查询耗时长等问题,而SQL Server上的分区视图优化技术也有其局限性,已无法满足高效迅速处理这类数据的需求[6-7]。为了提高省级中心站数据处理速度,提升空气质量数据分析评价工作效率。本文基于Spark分布式集群环境和Hive数据仓库,提出了一种多维度的分区存储策略对省级中心站中的空气质量大数据查询进行了优化。
1 大数据处理平台
1.1 Spark与Hive
Spark是目前最受欢迎的分布式计算引擎之一,被广泛应用于大规模数据处理。……
登录APP查看全文
