基于MapReduce的大数据在线聚集优化设计
2021-04-27李骏
河北大学学报(自然科学版) 2021年2期
李骏
(成都工业学院 教务处,四川 成都 611730)
大数据具备数据规模达到PB级别、数据组织形式多样、数据增长速率快、处理时间较为敏感等特征[1-3]. 伴随互联网应用的飞速发展,大数据量呈现几何式增长态势,在如此巨大的数据量中包含着具备极高价值度的信息资源,但是受到数据规模和内存等因素限制,即使在云计算模式下,大数据的分析处理也无法满足用户实时交互需求. 为此快速、精准挖掘大数据中潜在信息价值,对促进各大行业进步十分重要[4-5].
在线聚集具备快速、精准获取查询估计结果的特点受到了学者的广泛关注. 文献[6]提出基于多维分层采样的大数据在线聚集方法,解决了查询出现小分组或低选择率时产生的估计结果不准确问题;文献[7]提出了基于POI的大数据在线聚集方法,利用兴趣点为数据源,有效实现了数据的聚类.但这2种方法的大数据在线聚集执行时间并不具备显著优势.
MapReduce是一种编程模型,其中心思想是“Map(映射)”和“Reduce(归约)”,可用于大规模数据集的并行运算. 为此本文提出基于MapReduce的大数据在线聚集优化程序设计方法,进一步提升大数据在线聚集执行性能,更好地服务于大数据应用,为大数据查询处理的发展做出有益贡献.
1 基于MapReduce的大数据在线聚集优化程序设计
1.1 基于列存储的MapReduce大数据并行连接算法
通过分片聚集实现大数据的并行连接,并采用启发式的优化方法优化各节点的子连接,综合上述步骤实现了基……
登录APP查看全文