基于神经机器翻译编码器的语义学习分析
2021-04-29徐东钦李军辉贡正仙
徐东钦,李军辉,贡正仙
(苏州大学 计算机科学与技术学院,江苏 苏州 215006)
0 引言
近年来,神经机器翻译(neural machine translation)[1-3]凭借其序列到序列(Seq2Seq)[4]框架的良好表现,已成为主流的机器翻译方法。序列到序列框架包含一个编码器和一个解码器,其通过编码器将源端序列编码成高维度向量,再通过解码器将高维度向量解码获得目标端序列。在这一过程中,各类信息皆表示为高维度向量,很难直观地去解释编码器与解码器的工作,例如:
(1)编码器是否能够从源端序列中捕获源端语义信息?
(2)如果编码器能够捕获源端语义信息,那么捕获的是何种语义信息?对下游任务是否有帮助?
(3)如果为编码器提供更多的语义信息,是否能够提升神经机器翻译的性能?
本文的工作侧重于回答上述三个问题。特别地,本文使用了抽象语义表示(abstract meaning representation, AMR)[5]作为语义信息的表示载体。AMR是近些年来备受关注的一种语义表示方法,其把自然语言文本以句子为单位,将句子的语义抽象表示为单根有向无环图。如图1(c)所示,句子中lost和our等词分别被映射 “lose-02”和“we”等AMR图中节点,这类节点被称为概念(concept)。连接概念之间的边,如图1中“:ARG1”和“:manner”等表示两个概念之间有向的语义关系。如图1中(d)所示,AMR图文本表示中“~e.N”等表示概念、边与源端序列中第N个词所对齐(从第0个词开始计数),如“bitter~e.0”表示“bitter”与源端序列中第0个词“Bitterly”对齐。“w”等变量表示指示引用节点,如“l”指向“lose-02”。需要注意的是,目前AMR还无法做到表述句子的完整语义。AMR侧重的是描述某个句子内部存在的概念(concept),以及它们之间的语义关系,但同时忽略了时态、名词单复数等信息。……
