大数据环境下的信息架构与数据模型
2018-03-29赵栋祥赵一鸣
洪 漪 赵栋祥 赵一鸣
(1.美国MedeAnalytics公司,艾默里维尔市,加利福尼亚州,美国 94608;2.武汉大学信息资源研究中心,武汉,430072)
1 引言
在大数据时代之前,人类处理和使用的数据主要是文献、关系数据库等。而到了大数据时代,数据来源异常丰富,包括科学仪器、社交媒体与网络、电子零售、传感器数据、智能终端、医疗记录、金融交易等[1]。每个数据来源在数据的规模、类型、频率、速度和真实性等方面都显示出不同的特征。
业界通常用4个V(即Volume、Variety、Velocity、Value)来概括大数据的特征[2]。其中,Volume指海量的数据总数,Seagate和IDC的一项新研究 “数据时代2025”表明,到2025年全球数据量将会从2016年的16ZB上升至163ZB[3]。Variety指数据形式和结构的多样性,相对于以往便于存储的结构化数据,非结构化数据包括网络日志、音频、视频、图片、地理位置信息等越来越多,非结构化数据占到了总数据量的80—90%。Velocity指快速的数据生成速度,据估计到2018年,全球网络流量将达到50000GB/S,这对数据处理速度和时效性提出了更高的要求。Value指数据价值,如何从多源、海量、异构数据中排除不相关信息的干扰,从而揭示关联模式、预测未来趋势、挖掘数据价值是大数据的关键。
虽然我们拥有如此丰富的数字信息资源,但是对数字信息资源的开发利用却不容乐观。据Gartner研究报告显示,大约有85%的世界财富500强企业无法利用大数据来获得竞争优势[4]。这意味着,只有少数的大企业会利用大数据分析技术超越已知、洞见未来,并带来更强的竞争优势[5]。由此可见,整体范围内数字信息资源的开发利用严重滞后。……
