面向空间大数据的分布式存储策略
2019-03-21唐桂文韩嘉福李洪省
计算机技术与发展 2019年3期
关键词:数据库
唐桂文,韩嘉福,李洪省
(1.北京市西城经济科学大学,北京 100035;2.中国科学院 地理科学与资源研究所,北京 100101)
0 引 言
现代社会已经进入了产生和使用空间大数据的时代。空间大数据具有数据量大、多源异构性、多时空尺度、多维度等特点[1],在总量上日益膨胀,使得空间大数据的存储逐渐成为一个更独立的技术问题。面对不断增长的空间数据利用与共享的需求,如何将这些空间大数据进行有效地存储和管理,以更好地进行数据共享,成为了一个急需解决的问题。
针对大数据存储,目前主要技术手段有基于Hadoop云计算、基于NoSQL数据库、基于分布式等。
Hadoop以其高可靠性、高扩展性、高效性和高容错性,特别是在海量的非结构化或半结构化数据上的分析处理优势[2],为大数据的处理提供了一种思路。但是Hadoop使用的MapReduce模型更适合简单的统计,无法支持更多复杂的数据分析及可视化展示。
近年来以BigTable、HBase、MongoDB为代表的NoSQL数据库发展迅速,它采用key-value的数据存储模式[3-5],很好地弥补了关系型数据库在海量数据存储中存在的不足,且部署过程简易。此类数据存储方式不用事先为数据建立字段,随时可以自由添加字段,但会增加数据结构解析难度且会产生数据冗余。
基于分布式系统的存储方式主要有分布式数据库和分布式文件系统两大块。分布式数据库是数据库技术与计算机网络技术结合的产物,利用现有成熟的关系数据库技术,将数据存储于数据库中,数据可以分布在多个节点上[6],分布式数据库适用于结构化的数据存储;……
登录APP查看全文
