APP下载

基于海量异构数据索引语义查询的关键模型研究

2018-06-13桑海翎郭文忠

福州大学学报(自然科学版) 2018年3期

桑海翎, 郭文忠

(1. 福建广播电视大学教学管理中心, 福建 福州 350013; 2. 福州大学数学与计算机科学学院, 福建 福州 350116)

随着互联网、 物联网等信息技术的发展, 数据资源呈现出指数式的增长[1]. 根据当前的数据应用情况, 互联网数据处理中心经过数据监测并进行了合理预测, 分析结果表明全球数据量将持续增加, 到2020年的总数据将达到35 ZB. 毫无疑问, 当今正在迎来一个大数据时代[2]. 作为大数据的主体, 非结构化数据也正在高速发展, 这对传统的非结构化数据管理提出了新的挑战. 大量的异构数据包括结构化和非结构化数据. 在以往研究中, 相应的索引以及语言的查询主要是针对某一种数据类型来进行设计和构建. 结构化数据一般使用SQL语言进行查询, 通常在一个或几个属性上建立索引来加速查询效率, 如B+树、 Hash等. 本研究基于海量异构数据特征模型, 通过对非结构化数据进行构建模型并将数据相关问题进行重点分析和研究, 如原始数据及特征数据的存储和查询问题、 数据的可视化问题、 如何选择特征空间等.

1 非结构化数据模式分析研究现状

基于非结构化数据特征, 可以开展非结构化数据的模式分析, 模式分析的结果是形成非结构化数据的相关性判断及浅层语义挖掘, 支撑数据的分类、 聚类、 推荐、 相关性搜索等各类应用. 为了应对海量数据的挑战, 并充分利用数据的规模效应产生更好的模式分析结果, 目前非结构化数据模式……

登录APP查看全文