大数据时代机器学习的新趋势
2012-03-30陈康,向勇,喻超
电信科学 2012年12期
陈 康,向 勇,喻 超
(1.中国电信股份有限公司广东研究院 广州 510630;2.广州优亿信息科技有限公司 广州 510630)
1 引言
机器学习是人工智能的一个核心研究领域。1997年Mitchell T M在“Machine Learning”一书中给出了机器学习的经典定义“计算机利用经验改善系统自身性能的行为”[1]。人类具有学习能力,其学习行为背后具有非常复杂的处理机制,这种处理机制就是机器学习理论。机器学习主要研究如何使用计算机模拟和实现人类获取知识(学习)过程,创新、重构已有的知识,从而提升自身处理问题的能力。机器学习的最终目的是从数据中获取知识。
近年来,大数据吸引了越来越多的关注。从各种各样的数据(包括结构化、半结构化和非结构化数据)中快速获得有价值信息的能力,就是大数据技术。传统数据分析技术着重于用预先设定的适当统计方法对数据进行分析,以求发现数据的功能和价值;与传统数据分析相比,大数据技术的其中一个核心目标是要从体量巨大、结构繁多的数据中挖掘出隐藏在背后的规律,从而使数据发挥最大化的价值。从大量结构繁多的数据中挖掘隐藏规律,对人工操作而言,几乎无能为力,必须与机器学习相结合,由计算机代替人去挖掘信息,获取知识。大数据技术的目标实现与机器学习的发展必然密不可分。
业界对大数据的特征也进行了归纳,主要包括以下4点(“4个 V”):数据体量巨大 (volume)、数据类型繁多(variety)、数据价值密度低(value)、有很多实时数据要求快速处理(velocity)。……
登录APP查看全文
