APP下载

面向汉维机器翻译的BERT 嵌入研究

2021-12-20杨雅婷

计算机工程 2021年12期
关键词:效果模型

陈 玺,杨雅婷,董 瑞

(1.中国科学院新疆理化技术研究所,乌鲁木齐 830011;2.中国科学院大学,北京 100049;3.新疆民族语音语言信息处理实验室,乌鲁木齐 830011)

0 概述

近年来,基于深度学习的神经机器翻译(Neural Machine Translation,NMT)技术取得了较大的进展,网络结构从循环神经网络[1-3]发展到卷积神经网络[4],再到完全基于自注意力机制的网络[5]。在这些不同的网络结构中,基于自注意力机制而又高度并行化的Transformer[5]取得了非常好的效果。

目前的神经机器翻译模型在面对英法、英中等拥有大规模平行语料资源丰富的语言对时,取得了较好的翻译效果。但是由于汉语-维吾尔语平行语料的缺乏且2 种语言的差异性较大,其在汉维翻译方面效果并不如维吾尔语-汉语上翻译[6]。本文主要研究如何提升汉维神经机器翻译模型的翻译效果。

BERT[7]、Roberta[8]、GPT[9]等预训练语言模型在大规模的无标签单语语料上训练得来,在一系列自然语言理解任务(如文本分类[10]、阅读理解[11]等)上都取得了非常好的效果。BERT 是一种多层的基于Transformers 的双向编码表示模型,通过在大量的单语语料上以屏蔽语言模型建模任务(Masked Language Model,MLM)和下一句预测任务(Next Sentence Prediction,NSP)为训练目标得到。

尽管BERT 在一系列自然语言理解任务上取得了不错的效果,但其在自然语言生成任务(如机器翻译、摘要生成[12]等)上的应用却鲜有人探索。文献[13]比较了在机器翻译翻译模型当中应用BERT的几种方式,包括将BERT 作为NMT 模型的输入嵌入层、利用BERT 的参数初始化NMT 模型的编码器层然后微调BERT、利用BERT 的参数初始化NMT模型的编码器层然后冻结BERT 参数。……

登录APP查看全文

猜你喜欢

效果模型
一半模型
按摩效果确有理论依据
重尾非线性自回归模型自加权M-估计的渐近分布
迅速制造慢门虚化效果
抓住“瞬间性”效果
3D打印中的模型分割与打包
模拟百种唇妆效果
FLUKA几何模型到CAD几何模型转换方法初步研究
3D—DSA与3D—CTA成像在颅内动脉瘤早期诊断中的应用效果比较
组合练习难度大,贴近实战效果佳