大数据近似分析方法综述
2021-08-09张美范王宏志
张美范 王宏志


摘 要: 大数据分析旨在从大量复杂的数据中获取价值。查询驱动的数据分析是大数据分析中最主要的部分。由于数据量的庞大,在大数据上获取准确的分析结果将带来极大的存储和计算代价。为解决这一困难,大数据近似分析方法应运而生。本文将主要针对大数据近似分析中的频率估计问题、近似查询处理问题、查询选择性估计问题近十年的解决方法进行总结和归纳。不同于以往以数据库为主视角的分析方法的总结,本文中将涵盖近几年应用或结合机器学习方法来处理上述问题的新方法。
关键词: 大数据分析; 频率估计; 近似查询处理; 查询选择性估计
文章编号: 2095-2163(2021)03-0061-06 中图分类号:TP391.41 文献标志码:A
【Abstract】Big data analytics aims to obtain value from a large amount of complex data. Query-driven data analytics is the most important part of big data analytics. Due to the huge amount of data, obtaining accurate analysis results on big data will bring great storage and calculation costs. To solve this problem, big data approximate analysis methods came into being. This article mainly summarizes the frequency estimation methods, approximate query processing methods, and query selectivity estimation methods in big data analytics in the past ten years. Different from the previous summary of analysis methods based on the database perspective only, this article will cover the new methods of applying or combining machine learning methods to deal with the above problems in recent years.
【Key words】 big data analysis; frequency estimation; approximate query processing; query selectivity estimation
0 引 言
大数据中蕴含着海量的信息和巨大的价值,然而数据的庞大复杂使得人们不能或难以直接从数据中获得有价值的信息。大数据分析就是从大量复杂的数据中有目标地获取价值的过程。传统的数据分析方法难以应对极速增长的数据量,满足快速响应的需求。为解决这一问题,一系列近似方法应运而生,本文主要针对近些年大数据近似分析中频率估计、近似查询处理、查询选择性估计这三种基础分析任务的方法进行了总结。随着机器学习、人工智能领域的不断发展,近些年研究者们尝试将机器学习方法和大数据分析相结合,利用机器学习模型的推理预测能力,提高大数据分析方法的性能。
本文归纳并总结了近些年有代表性的大数据近似分析方法,同时涵盖了近些年将机器学习方法应用到大数据分析领域的新方法。……
