信息传递增强的神经机器翻译*
2021-02-03史小静宁秋怡季佰军段湘煜
史小静,宁秋怡,季佰军,段湘煜
(苏州大学自然语言处理实验室,江苏 苏州 215006)
1 引言
神经机器翻译NMT(Neural Machine Translation)[1 - 3]是完全采用神经网络完成源语言到目标语言的端到端的翻译系统,吸引了众多学者的关注。最初,神经机器翻译模型是基于循环神经网络RNN(Recurrent Neural Network)[4]实现端到端的翻译。注意力机制[5]是对神经机器翻译编码器-解码器(Encoder-Decoder)框架的完善,使得模型能够在解码时只关注源语言句子中的一部分区域,动态地生成源语言信息,极大地提高了翻译译文的质量。为了提高神经机器翻译的表达能力,研究人员采纳多层神经网络结构,实现了基于卷积神经网络CNN(Convolutional Neural Network)[6]和自注意力机制(Self-Attention)[7]的多层神经网络,使得神经机器翻译在多项翻译任务中达到了最先进的水平。
编码器-解码器[8,9]框架是神经机器翻译模型的经典框架,可以由不同的神经网络实现,如循环神经网络RNN[4]、门限循环单元GRU(Gated Recurrent Unit)[5,9]、长短期记忆神经网络LSTM(Long Short-Term Memory)[10]、卷积神经网络CNN[6]和Transformer[7]等。一般地,编码端对源端的输入句子由低层到高层逐层生成语义向量,解码端根据编码端最后一层的输出和已经解码生成的词的隐藏层表示作为输入,通过一系列计算得到对应的目标端的译文。多层神经网络中逐层传递的过程往往存在梯度消失或者梯度爆炸的问题,残差网络(Residual Network)[11]的引入有效地缓解了梯度消失和梯度爆炸的问题,但多层神经网络的逐层信息传递过程中的信息退化问题仍然不能得到妥善解决。
本文提出各层间信息融合传递……
