一种基于海量数据的信息云系统及其关键技术研究
2012-06-27屠要峰钱煜明
电信科学 2012年12期
屠要峰,钱煜明
(中兴通讯股份有限公司南京研发中心 南京 210012)
1 引言
互联网的迅速发展为当代信息传播提供了一条全新的途径,对传统的信息传播方式(报纸、电视等)产生了强大的冲击。尤其是Web2.0技术的出现和不断发展,使得互联网信息传播方式在时间、空间、效率方面渐渐确立了明显的优势地位。Web已经成为现代社会各种信息的载体,而且此载体的信息量是海量的,IDC(互联网数据中心)数据显示,如今全网数据已达 180万 PB(1P=250),而且 90%是非结构化的数据,2015年将达到800万PB[1],这些数据涉及新闻、招聘、广告、会议、技术信息、社交网络、论坛等各方面。
互联网在快捷、方便地传播海量信息的同时,也带来了相应的问题,如信息超载、信息不完整、信息形式不一致等。因此,通用的信息检索技术得到了迅速发展,如Google、百度,其采用关键词为基础,帮助用户获取相应的信息。搜索引擎只是部分缓解了信息检索的问题,并没有解决信息分析、信息处理的问题。同时,信息检索需要用户实时参与,对于信息的聚合、自动发现等不能实现自动化、智能化处理[2]。如何实现互联网海量数据自动采集、聚合、智能分析、自动推送等是业界主要的研究方向。如:苹果公司Siri智能机器人实现了根据用户需求进行智能分析和处理,但是并未实现信息的自动推送,仅应用在移动终端领域。RSS信息订阅解决了部分信息聚合的问题,但存在信息源缺乏、单一、信息源需要人工处理等问题。
目前,Web信息采集技术广泛应用在Web数据挖掘、搜索引擎、电子商务、页面有效性分析等领域,所应用到的领域不同,其信息采集技术也各有不同[2]。……
登录APP查看全文
