基于Hadoop的并行化聚类系统的设计
2016-07-26张友海李锋刚安徽职业技术学院信息工程系安徽合肥230011合肥工业大学管理学院安徽合肥230009
赤峰学院学报·自然科学版 2016年9期
关键词:数据挖掘
张友海,李锋刚(1.安徽职业技术学院 信息工程系,安徽 合肥 230011;2.合肥工业大学 管理学院,安徽 合肥 230009)
基于Hadoop的并行化聚类系统的设计
张友海,李锋刚
(1.安徽职业技术学院 信息工程系,安徽 合肥 230011;2.合肥工业大学 管理学院,安徽 合肥 230009)
摘 要:数据挖掘技术可以找出大量数据中的隐含的价值并对数据做作出预测.聚类分析是挖掘数据价值的重要手段之一,在识别数据的内在相似性具有极其重要的作用.近些年来,随着互联网技术的飞跃式发展,各行各业产生的数据以爆炸式的增长.面对如此庞大的数据量,传统的数据挖掘处理方式已经无法胜任,而以Hadoop生态圈为代表的大数据处理方法,提供了成熟且易用的工具技术支撑.因此,基于Hadoop相关工具来设计一种并行化聚类系统具有非常重要的意义.
关键词:数据挖掘;聚类分析;hadoop
1 引言
互联网的普及和各种互联网技术的快速应用,导致大量数据,充斥在人们生产和生活中.如何有效地从这些繁复复杂的数据中提取有价值的隐含信息意义重大.所谓聚类分析就是将包含有大量数据对象的数据集合划分为若干个类或者是簇,使得同一类或者簇中的对象彼此具有较高的相似度,而不同的类或者簇中的对象之间的相异度则比较大.聚类算法不同于其他的数据挖掘算法,它不依赖于预先已经定义好的簇或者类的特征.在数据挖掘领域,学术界提出了若干的基于不同思想的聚类算法,其中应……
登录APP查看全文