分布式数据流决策树VFDT分类算法研究
2016-02-13刘寿强祁明
现代计算机 2016年36期
刘寿强,祁明
(1.华南师范大学物理与电信工程学院,广州 510006;2.华南理工大学经济与贸易学院,广州 510006)
分布式数据流决策树VFDT分类算法研究
刘寿强1,2,祁明2
(1.华南师范大学物理与电信工程学院,广州 510006;2.华南理工大学经济与贸易学院,广州 510006)
随着大数据时代的到来,网络上充斥着大量高速变化的数据流,然而传统数据挖掘技术不能很好地直接应用到数据流上。研究基于决策树的数据流分类挖掘算法,其研究思路是首先描述一般决策树;然后重点阐述数据流决策树VFDT的算法的实现,采用Twitter Storm分布式流式计算框架的并行计算和Yahoo SAMOA机器学习平台,对VFDT算法进行并行化设计;最后通过实验验证并行化的VHT决策树算法具有良好的运行效率与性能。
数据流;数据挖掘;决策树;Storm;SAMOA
1 数据流及其典型处理平台概述
随着互联网应用的发展,产生大量的流数据(下文采用通用的说法“数据流”),与传统的静止数据不同。数据流是海量的、高速的、实时的。其蕴涵着大量信息,可以用来作为智能决策的依据。预测和分类是基本数据分析两种形式[1],可以用于提取描述重要数据类的模型或预测未来的趋势。目前大部分算法是内存驻留算法,通常假定数据量很小,无法有效地应用于数据量潜在无限的数据流。传统的数据挖掘方式并不能很好地适用于数据流挖掘,数据流分类对传统的分类技术提出了许多新的挑战。由于分类理论和方法在不同领域有着相当广泛的应用,在对大量数据流进行数据挖掘处理时,如何利用有限的计算资源对实时的数据流信息进行快速的处理是一个很大的挑战和难点,因此,研究快速的、精确的、稳定的数据流分类系统具有极高的理论价值和应用价值。……
登录APP查看全文
