APP下载

面向大数据环境的大规模机器学习工具研究综述

2021-11-21

软件导刊 2021年1期
关键词:数据挖掘用户模型

(北方工业大学经济管理学院,北京 100144)

0 引言

伴随着互联网产业的兴起,大数据迅速成为学术界、企业界甚至政府机构关注的热点。相对于传统数据,人们将大数据的特征总结为5 个大写的“V”,即体量大(Vol⁃ume)、速度快(Velocity)、模态多(Variety)、难辨识(Veraci⁃ty)和价值大密度低(Value)[1]。人们关注大数据的一个重要目的在于从规模巨大、纷繁复杂的数据中探求规律,释放数据所蕴含的价值;否则,数据再大,也毫无意义。而作为人工智能重要分支的机器学习,在大数据价值发现中扮演着不可或缺的角色。

机器学习在学术界和产业界都有巨大实用价值,尤其是大数据环境下的机器学习算法成为学术界和工业界共同关注的课题。一般而言,大规模机器学习算法通常采用分而治之思想,通过分布式计算方式,将数据或者模型进行分割,进而出色地完成对大规模数据的模型训练及预测[2]。然而,从零开始构建一个分布式机器学习算法是繁琐和重复性的。针对该问题,越来越多开源和商业性的大规模机器学习工具应运而生。大规模机器学习工具的产生,降低了机器学习算法的使用门槛,减少了科研技术人员的重复性劳动,使他们将更多的精力集中在创新研究和应用分析上,极大地提高了生产效率。并且,开源大规模机器学习工具平台的出现,也顺应了当前潮流,开源方式能够充分集中大众智慧,让更多的科研人员投身于算法研究和工具平台建设中,也更快更好地促进了机器学习发展。……

登录APP查看全文

猜你喜欢

数据挖掘用户模型
一半模型
探讨人工智能与数据挖掘发展趋势
重尾非线性自回归模型自加权M-估计的渐近分布
基于并行计算的大数据挖掘在电网中的应用
关注用户
3D打印中的模型分割与打包
关注用户
关注用户
一种基于Hadoop的大数据挖掘云服务及应用
如何获取一亿海外用户