一种分布式异构带宽环境下的高效数据分区方法
2021-01-05马卿云季航旭赵宇海毛克明王国仁
计算机研究与发展 2020年12期
马卿云 季航旭 赵宇海 毛克明 王国仁
1(东北大学计算机科学与工程学院 沈阳 110169)
2(东北大学软件学院 沈阳 110169)
3(北京理工大学计算机学院 北京 100081)
随着物联网、移动互联网、产业互联网和社交媒体等技术的飞速发展,每天都会产生大量的数据,人们已经身处大数据时代[1].根据国际数据公司(International Data Corporation, IDC)的预测,到2025年,全球的数据量将是现在的10倍,达到175 ZB.
大数据中有着丰富的信息,并且蕴含着巨大的价值[2].谷歌通过用户搜索词频的变化成功对冬季流感进行了预测,沃尔玛通过分析消费者购物行为对纸尿裤和啤酒进行共同销售,这些耳熟能详的案例都印证了这一点.但随着数据产生速度的加快,数据量的急剧增长,如何对庞大的数据进行处理成为了新的难题.传统的单机处理已经无法满足大数据的需求,分布式的大数据处理框架应运而生.谷歌首先提出了用于大规模数据并行计算的编程模型MapReduce[3],引起了极大的反响,也因此促使了Hadoop[4]的诞生.之后为了改进传统MapReduce中运行效率低下的问题,基于内存计算的Spark[5]被提出.时至今日,为了追求更快的处理速度、更低的时延,Flink[6]开始崭露头角,并得到了飞速的发展.
与此同时,随着云计算[7]的兴起,包括谷歌、微软、阿里巴巴等在内的互联网公司都提供了大数据存储与分析的相关服务,众多企业开始选择将自己的业务上“云”.这些提供云服务的公司需要存储和处理的数据同样是海量的,为了更好地为客户提供服务,提供……
登录APP查看全文
