基于hive的日志仓库构建研究
2016-12-19蒋焕亮
蒋焕亮
摘 要: 随着电商平台、门户网站的访问量越来越大,产生的日志信息也越来越多,传统的日志文件处理方法无法满足需求。通过分析Hadoop分布式文件系统(HDFS)、并行计算框架MapReduce和数据仓库Hive技术特点,研究日志仓库的体系结构及关键技术并建立日志数据仓库。与数据库相比,数据处理效率显著提升。
关键词: 日志; 数据仓库; MapReduce; Hive
中图分类号:TP393 文献标志码:A 文章编号:1006-8228(2016)11-21-04
Establishment of Web logs data warehouses based on Hive
Jiang Huanliang
(Shaoxing Vocational&Technical College, Shaoxing, Zhejiang 312000, China)
Abstract: With the amount of access to the web-portal and electronic business platform more and more, the related Web logs is steadily increasing and the traditional Web logs file is unable to meet the requirements. The Web logs data warehouse is finally established by analyzing the technical characteristics of HDFS, MapReduce and Hive, and studying the architecture and key technology of logs data warehouse. Compared with the database, the data processing efficiency is significantly improved.
Key words: Web logs; data warehouses; MapReduce; Hive
0 引言
随着电商平台、门户网站的访问量越来越大,产生的日志信息也越来越多,传统的日志文件存储和日志处理难于满足要求。Web访问日志中包含了大量的用户行为信息,如访问信息、浏览信息、购买信息、偏好、关注点等。通过对日志的处理,并进行用户行为建模,可以得到有价值的信息,如用户的属性信息、用户标签、用户兴趣爱好、购买意向、再对这些用户的信息进行聚类,划分用户集,为Web个性化应用提供服务[1]。因此,日志文件的存储和处理具有非常重要的意义。
1 相关技术
1.1 hadoop技术
Hadoop系统运行于一个由普通服务器组成的计算集群,集群的主控节点控制和管理集群的正常工作、协调管理集群中从节点的数据存储和数据计算,每个节点均具数据存储和数据计算两种功能。Hadoop分布式文件系统(Hadoop Distributed File System,HDFS)负责控制和管理的主控节点是NameNode,而每个具体负责存储的从节点是DataNode。数据存储节点DataNode和计算机节点TaskTracker会设置在同一物理的从节点服务器上。为了能进行并行化计算,Hadoop提供了MapReduce并行计算框架,该框架能有效管理和调度整个集群中的节点来完成并行化程序的执行和数据处理,负责管理和调度整个集群进行计算的主控节点成为JobTracker,而每个负责具体的数据计算的是从节点TaskTracker。……
