基于MapReduce框架下的数据挖掘方法研究
2017-05-06杨震宇
中国高新技术企业 2017年4期
关键词:数据处理
杨震宇
摘要:大规模数据处理分析工作,在单个处理节点上部署时往往会遇到机器性能局限所带来的计算瓶颈。如今,技术更加先进且成本低廉的分布式计算平台为这一问题带来了改善的解决方案。文章运用MapReduce框架这一优势,研究了将数据挖掘的任务部署到分布式平台上的方案以及提出了相关研究展望。
关键词:MapReduce框架;Hadoop;数据挖掘方法;数据处理;聚类算法 文献标识码:A
中图分类号:TP316 文章编号:1009-2374(2017)04-0008-03 DOI:10.13535/j.cnki.11-4406/n.2017.04.005
1 概述
随着时代发展,各行各业的日常运营过程中都会产生海量的数据信息,甚至这些信息正呈几何级数增长。无论是零售业、制造业还是政府机关和校园教育都可以從数据信息中发掘出有用的信息来帮助领导者做出决定,进一步优化自身发展的各处细节。数据挖掘就是解决这类问题的重要方法,但随之而来的便是如何快速有效地处理超大规模数据的疑问,提高计算核心的计算能力的确是重要的解决方案,而这确实不易实现。
鉴于半导体技术的不断进步,科技工艺几乎触及其极限,当年的摩尔定律已经无法支撑着如今的制造厂商有效定期提升其产品的处理、计算能力。对于解决大数据信息的有效处理问题,时下流行的方案便是应用云计算,将分析处理任务交给分布式计算平台,在节约计算的时间同时,巧妙地规避了硬件既定的制约。由当年Google公司提出的MapReduce计算模型已成为了分布式计算平台中首选的数据计算框架,本文将对在该框架下部署大规模的数据挖掘进行研究,并探寻可行的解决……p>
登录APP查看全文
