基于Spark框架的电力大数据清洗模型*
2017-12-21王冲邹潇
电测与仪表 2017年14期
关键词:检测
王冲,邹潇
(1.国网内蒙古东部电力有限公司信息通信分公司,呼和浩特010020;2.兰州大学 数学与统计学院,兰州730000)
0 引 言
电力大数据具有数量大、维度高,数据模式繁多等特征,在电力大数据的采集过程中,其不可避免的存在异常数据,对电力大数据清洗有很强的必要性[1]。国内外对电力大数据清洗研究主要有聚类和关联分析[2]、条件函数依赖[3]、马尔科夫模型[4]、DS证据理论[5]。大部分数据清洗技术都需要依赖数据模型本身构建异常数据识别规则,对检测到的异常数据做删除或均值填充处理,其缺点就是:破坏了数据的连续性、完整性、准确性。
针对以上电力大数据清洗难点,本文提出一种基于Spark框架的电力大数据清洗模型。相比一些电力大数据清洗模型,本文数据清洗模型减少人为干预,不需要根据数据关系模式设定识别规则,异常识别算法依赖于历史数据中的正常样本数据,且对异常数据修正是建立在其同一时间序列数据分析的基础上,最终能够实现对历史或实时数据中的异常数据清洗。
1 基于Spark框架的电力大数据清洗模型
电力大数据清洗是对检测到的电力大数据中异常数据进行修正的过程,利用Spark框架构建电力大数据清洗模型时分为以下几个阶段:数据准备、正常簇样本获取、异常数据识别、异常数据修正、修正数据存储。数据准备即将存储在传统关系型数据库中的数据转存在适合于大数据处理的非关系型数据库中,然后加载到Spark的弹性分布式数据集(RDD)中;……
登录APP查看全文
