面向汉维机器翻译的BERT 嵌入研究
2021-12-20杨雅婷
陈 玺,杨雅婷,董 瑞
(1.中国科学院新疆理化技术研究所,乌鲁木齐 830011;2.中国科学院大学,北京 100049;3.新疆民族语音语言信息处理实验室,乌鲁木齐 830011)
0 概述
近年来,基于深度学习的神经机器翻译(Neural Machine Translation,NMT)技术取得了较大的进展,网络结构从循环神经网络[1-3]发展到卷积神经网络[4],再到完全基于自注意力机制的网络[5]。在这些不同的网络结构中,基于自注意力机制而又高度并行化的Transformer[5]取得了非常好的效果。
目前的神经机器翻译模型在面对英法、英中等拥有大规模平行语料资源丰富的语言对时,取得了较好的翻译效果。但是由于汉语-维吾尔语平行语料的缺乏且2 种语言的差异性较大,其在汉维翻译方面效果并不如维吾尔语-汉语上翻译[6]。本文主要研究如何提升汉维神经机器翻译模型的翻译效果。
BERT[7]、Roberta[8]、GPT[9]等预训练语言模型在大规模的无标签单语语料上训练得来,在一系列自然语言理解任务(如文本分类[10]、阅读理解[11]等)上都取得了非常好的效果。BERT 是一种多层的基于Transformers 的双向编码表示模型,通过在大量的单语语料上以屏蔽语言模型建模任务(Masked Language Model,MLM)和下一句预测任务(Next Sentence Prediction,NSP)为训练目标得到。
尽管BERT 在一系列自然语言理解任务上取得了不错的效果,但其在自然语言生成任务(如机器翻译、摘要生成[12]等)上的应用却鲜有人探索。文献[13]比较了在机器翻译翻译模型当中应用BERT的几种方式,包括将BERT 作为NMT 模型的输入嵌入层、利用BERT 的参数初始化NMT 模型的编码器层然后微调BERT、利用BERT 的参数初始化NMT模型的编码器层然后冻结BERT 参数。……
