基于Hadoop的海量数据处理平台
2021-09-10国标丁帅男吴雨桐
国标 丁帅男 吴雨桐
【摘 要】近几年,云计算产业飞速发展,大数据处理技术也在不断成熟。与此同时,国内移动互联网市场规模不断扩大,用户数量己经超过5亿,并带来了海量的移动互联网流量数据。在此背景下,如何基于云计算大数据处理技术来承载海量网络数据处理业务,是一个非常有研究价值的课题。
【关键词】流量数据;Hadoop;数据处理
一、MapReduce分布式处理技术
Hadoop平台的MapReduce框架采用主从架构,由一个JobTracker主节点和多个TaskTracker从节点构成。JobTracker模块负责MapReduce作业的调度,包括分配用户提交的作业执行顺序、Map任务和Reduce任务的分配和执行,推测性任务的执行等,从节点中TaskTracker模块负责处理主节点指派的任务,包括执行Map任务、Reduce任务和推测性任务。MapReduce框架运行流程如下。
(一)用户提交作业。用户编写自己的MapReduce程序并在客户端节点上运行,作业客户端实例化后,向JobTracke:模块提交该作业信息,申请分配作业的ID号。然后作业客户端在验证本次作业相关信V、无误的情况下,将作业资源存放到分布式文件系统中,默认情况下,Hadoop使用HDFS作为其文件存储系统。最后客户端向JobTracker模块提交作业执行请求。
(二)JobTracker初始化用户作业。JobTracker收到用户提交的作业后,创建该作业实例对象并配置相关数据,包括该作业使用的Jar包存放位置、输入数据分块信J自、以及作业对应的配置文件信息、等等。然后JobTracker根据其配置的一调度算法(默认为先进先出调度算法)将该作业放入其作业对待,用于后续分配。
(三)任务分配。当前MapReduce的机制中使用心跳通信机制来进行任务分配。……
