APP下载

分布式实时日志密度数据流聚类算法及其基于 Storm 的实现

2017-05-02张辉王成龙王伟

中国新通信 2017年6期

张辉+王成龙+王伟

【摘要】 日志對于每个系统来说,都是不可忽视的一部分。现阶段构建的日志分析平台对数据的处理响应时间差较大,实时性不能得到保证,因此 提出了基于Storm 框架的实时日志密度数据流聚类算法RL-DSCA(Real-time Log density stream clustering algorithm)。该算法综合了经典数据流聚类框架 Clustream和一种基于密度的聚类算法DBSCAN实现了多粒度的数据存储。算法可以实现多线程并行的增量更新。设计RL-DSCA算法基于Storm 的实现方案,通过ELK进行实时数据采集,选用Kafka作为中间件实现数据缓冲,Redis存储中间结果,最后部署 Storm 的拓扑对RL-DSCA算法进行实现。性能分析及实验结果表明: Bolt线程数量的增加不会影响到聚类的效果,RL-DSCA算法达到了较高的精度。

【关键字】 RL-DSCA ELK Storm Kafka Redis 增量更新

一、引言

日志信息可以作为特定指标项的分析源来处理某些特定的信息,将日志数据作为原始数据,这样有助于数据分析的准确性。但是日志数量巨大,如何准确、及时的筛选海量日志中的关键信息成为了亟待解决的问题。

聚类分析是处理数据流的常用分析手段,本文RLDSCA算法使用两层聚类框架处理数据同时兼顾实时和历史离线数据,并加入了DBSCAN算法处理可能出现的噪声数据和非球形数据,并将其应用到Storm的计算架构。对Storm计算架构设计实验从聚类精度和计算效率方面对RL-DSCA算法的有效性进行了验证。

二、Storm计算框架

BackType开发了分布式计算系统Storm,并在2011年被Twitter开源,该系统能够很容易可靠地处理无界持续的流数据,进行实时计算。

三、聚类算法分析

3.1 Clustream算法概述

登录APP查看全文