APP下载

大规模语言模型的跨云联合训练关键技术

2023-09-21潘囿丞PANYoucheng侯永帅HOUYongshuai杨卿YANGQing余跃YUYue相洋XIANGYang

中兴通讯技术 2023年4期
关键词:语言模型

潘囿丞/PAN Youcheng,侯永帅/HOU Yongshuai,杨卿/YANG Qing,余跃/YU Yue,相洋/XIANG Yang

(鹏城实验室,中国 深圳 518055 )

大规模语言模型是一种使用深度学习方法技术在大规模无标注文本语料数据上进行训练的人工智能方法。近年来,这类模型得到了快速发展,模型能力实现极大提升。然而,模型的参数规模也变得越来越大。例如,2018 年谷歌的BERT-Base 模型只有1.1 亿个参数[1],而到了2020 年,OpenAI 的GPT-3 模型的参数量已经达到1 750 亿个[2]。随着模型参数的增加,模型训练所需的算力资源也变得更加庞大。BERT-Base 模型可以在单张图形处理器(GPU)上训练,而GPT-3模型则需要在数千张GPU上进行数月的训练。当前,单个算力集群很少具备数千张GPU 算力卡的规模,即使是那些具有数千张卡的算力集群,也很难将它们在长时间内集中用于同一个任务。因此,为了满足大规模语言模型的训练需求,需要将多个算力集群的资源联合训练来提高效率。随着“东数西算”工程的逐步开展,中国各地建立了大量的算力集群。异地跨云计算将成为今后大模型训练的可行方式。

1 基于多算力集群的跨云训练方法

1.1 跨云计算的并行训练方式

在跨云集群环境中进行模型训练,需要解决不同云集群之间参数的传递和同步问题,以及由大量数据跨云传输的时间开销导致模型训练速度慢的问题。为了提升训练速度,训练任务被拆分到多个不同的算力集群上。利用这些集群的算力,可以实现对任务的并行处理。根据不同的任务需求和场景,跨云训练可以采用不同的并行策略,包括数据并行、模型并行和流水线并行等。……

登录APP查看全文

猜你喜欢

语言模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
语言是刀
让语言描写摇曳多姿
多向度交往对语言磨蚀的补正之道
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
我有我语言
论语言的“得体”
一个相似模型的应用