基于分布式流计算的运维数据分析
2018-04-09陈希杨世登吴志力
电子技术与软件工程 2018年5期
陈希 杨世登 吴志力
摘 要 随着运维领域数据采集技术的不断更新,出现了大量实时的非结构化数据,这些实时产生的数据如同流水一样源源不断地流入到数据仓库。如何实时获取运维数据流中的关键信息,并实现快速精准分析至关重要。单靠当前传统的批处理模式很难实现。所以,一种全新的分布式流计算处理模式应运而生,这种处理模式以其良好的扩展性、灵活性、易用性受到业界的欢迎。本文基于分布式流计算技术,采用了插件式可配置的设计理念,构建了分布式的运维分析系统。通过可配置化的资源管理,实现新的监控资源自动注册、汇总注册节点、快速分析、处理、计算,实现对运维数据的实时展现。
【关键词】运维 管理 数据分析 分布式流计算
1 系统设计介绍
分布式流计算系统在各大科技公司拥有无可替代的重要地位,尤其是在在线及近线的海量数据处理上。低延时高可靠是其核心指标。
Spark是一种支持流式计算、批处理和实时查询的计算系统。仅使用一个通用的stack就能够解决一系列问题,同时减少开发及维护成本。除了Spark以外,Twitter的Storm也是比较出名的流式计算系统。
1.1 Spark的设计
Spark Streaming指的是将流式计算分解成一段段的、短小的批处理作业。Spark是这里的批处理引擎,负责把Spark Streaming中的输入数据按照批处理尺寸(比如1秒钟)切成一段段数据,每一段数据又转换成RDD,然后Spark Streaming会将DStream的Transformation操作转换为对RDD的Transformation操作,最后中间结果会保存在内存中。用户可根据业务需求,决定是否将整个流式计算的中间结果进行叠加,又或者直接放到外部存储上。……
登录APP查看全文
