PandaDB:一种异构数据智能融合管理系统∗
2021-05-23沈志宏赵子豪王华进刘忠新周园春
软件学报 2021年3期
沈志宏 ,赵子豪,2,王华进,刘忠新,胡 川,2,周园春,2
1(中国科学院 计算机网络信息中心,北京 100190)
2(中国科学院大学,北京 100049)
在大数据时代,随着各类应用的推广和使用,数据产生速度越来越快、数据体量越来越大.一方面,数据采集技术的迅猛发展,使得数据的结构更多样、种类更丰富.数据表现出多元异构的特点,非结构化数据在其中占有较大比重.有研究表明,视频、音频、图片等非结构化数据占据高达90%的比例[1].另一方面,近年来,数据中台、知识图谱等数据管理分析技术得到了广泛的应用.数据中台要求结构化/非结构化数据能够在统一的环境中得到良好的治理,以便支持多种应用;知识图谱,特别是多模态知识图谱[2],要求对底层结构化/非结构化数据进行融合关联分析,并支持用户进行交互式查询.这些技术均提出了对结构化/非结构化数据进行融合管理和分析的需求.
结构化数据通常具有较为规范、统一的形式.目前,针对结构化数据的管理和分析,已具有成熟的数据模型、查询语言和管理系统.与结构化数据相比,非结构化数据的管理方式存在着诸多差异,这给高效的结构化/非结构化数据的融合管理和分析带来了多方面的挑战.
(1)分离的存储管理方式,给结构化/非结构化数据的统一管理带来挑战.相对于结构化数据,非结构化数据占有更大的空间,出于读写效率考虑,非结构化数据往往单独存在于文件系统,或者对象存储系统,这……
登录APP查看全文
