分布式深度学习通信架构的性能分析*
2021-04-06张立志冉浙江赖志权
计算机工程与科学 2021年3期
张立志,冉浙江,赖志权,刘 锋
(国防科技大学计算机学院并行与分布处理国防科技重点实验室,湖南 长沙 410073)
1 引言
最近几年,分布式深度学习在语音识别[1,2]、 图像识别[3,4]、自然语言处理[5,6]和机器翻译等领域都取得了丰硕的成果。分布式深度学习在多节点上并行运行深度学习任务的能力,能够有效应对海量数据和超大神经网络模型的挑战,高效地训练出可用的模型,对人工智能的发展有极大的推动作用,因此对分布式深度学习加速大数据、大模型训练的研究是目前人工智能领域的主流方向之一。
大规模的深度学习任务往往要充分利用“大数据”并且有效训练“大模型”,但是随着海量数据和庞大模型规模的发展,训练数据的容量和模型参数的规模已经超出单节点的处理能力[7],逐渐成为深度学习发展的瓶颈。目前,更主流的解决方案是使用多机器、多GPU进行分布式深度学习的训练,即通过将大数据集和大规模深度学习问题分解到多台机器和设备上并行地处理这些问题。这种方案同时利用多个工作节点,采用分布式技术来执行训练任务,提高了深度学习模型的训练效率,减少了训练时间。为了提供所需的计算能力,通常需要几十甚至上百个GPU,在这个背景下,涌现出许多新的软硬件技术,包括GPU的兴起和大规模计算机集群的广泛使用。然而,当GPU节点数量增多时,协调GPU之间的通信也是一个复杂的问题。当只有2个GPU和几兆字节的参数时,GPU通信的方式影响较小;……
登录APP查看全文
