分布式机器学习中的通信机制研究综述
2021-11-05杜海舟
上海电力大学学报 2021年5期
杜海舟, 黄 晟
(上海电力大学 计算机科学与技术学院, 上海 200090)
神经网络学习作为机器学习的核心技术,经历了浅层阶段和深层阶段2个发展阶段。2006年HINTON G E等人[1]解决了深度网络的理论问题后,神经网络得到了前所未有的发展,并广泛应用于各行各业,如自动驾驶、人脸识别、语音识别[2]、文本理解[3-4]和图像分类[5-6]等领域。随着网络规模扩大和大数据[7-8]的兴起,用于训练神经网络的数据也越来越大,传统的单机训练难以应对这些挑战。如Google提出的语言模型Bert[9]包含3亿参数,ImageNet 数据集包含2万个类别共有1 500万张图片[10]。巨量的数据使得传统单机无法应对,故而许多研究者将目光转向分布式训练。但是,传统的分布式计算不能很好地适应深度学习的特性,因为传统的分布式计算侧重如何扩大 I/O,且由于任务迭代次数较少,所以对每次迭代之间的通信没有做太多的优化[11]。深度学习的迭代次数通常都是上万次,需要非常频繁的网络通信来同步参数,因此结合深度神经网络的算法特点设计分布式系统显得十分迫切。本文对目前主流的分布式机器学习中的通信机制进行了详细的综述,以期帮助研究者快速了解分布式机器学习中独特的通信机制,改进现在的解快方法。
1 分布式机器学习的优化
目前国内外涌现了大量针对分布式机器学习优化的研究工作,主要有以下两类。
一是针对优化算法本身的扩展。此类研究主要将深度学习中优化算法并行化,如将标准的梯度下降扩展为分布式梯度下降。……
登录APP查看全文
