MapReduce模型下的模糊C均值算法研究
2014-06-07王永贵李鸿绪
计算机工程 2014年10期
关键词:模型
王永贵,李鸿绪,宋 晓
(辽宁工程技术大学软件学院,辽宁葫芦岛125105)
MapReduce模型下的模糊C均值算法研究
王永贵,李鸿绪,宋 晓
(辽宁工程技术大学软件学院,辽宁葫芦岛125105)
针对模糊C均值算法需要不断迭代来计算样本数据的隶属度值以及聚类中心的特点,利用MapReduce模型解决海量数据下的模糊C均值问题,进而提出高效的模糊C均值算法。在Map阶段和Reduce阶段分别完成隶属度和聚类中心的计算,每次迭代都需要启动一次完整的MapReduce执行过程。通过多次迭代计算出隶属度值以及聚类中心,并更新聚类中心文件,供下一轮作业使用,重复执行这一过程直至得到最终聚类结果。实验结果表明,该算法能够有效减少MapReduce计算过程中的迭代次数,从而提高整体执行效率。
模糊C均值算法;MapReduce模型;海量数据;高效;迭代
1 概述
模糊均值C(Fuzzy C-means,FCM)算法是由Dunn最先提出的,随后被广泛应用于数据挖掘等领域。模糊C均值算法是聚类分析和模糊理论的结合体,聚类分析是对原有数据按照某种规律来进行数据分类的一个过程,模糊理论是进行描述和分析人类语言的模棱两可的理论。模糊C均值在处理少量维度低的数据时是有效的[1],但是在处理大量的高维度数据时,不能够在有效的时间内计算出聚类结果[2]。随着网络信息技术的发展,人们可以采集并利用的数据越来越多,因此,如何处理海量数据下的模糊C均值是迫切需要解决的问题。Google提出的MapReduce[3]并行编程框架,在处理海量数据问题上具有显著的优势[4],该模型具有良好的扩展性及容错性[5],能够满足人们对海量数据处理的需要[6],在大数据处理中起着重要的作用[7]。……
登录APP查看全文
