APP下载

基于神经机器翻译编码器的语义学习分析

2021-04-29徐东钦李军辉贡正仙

中文信息学报 2021年3期
关键词:语义单词信息

徐东钦,李军辉,贡正仙

(苏州大学 计算机科学与技术学院,江苏 苏州 215006)

0 引言

近年来,神经机器翻译(neural machine translation)[1-3]凭借其序列到序列(Seq2Seq)[4]框架的良好表现,已成为主流的机器翻译方法。序列到序列框架包含一个编码器和一个解码器,其通过编码器将源端序列编码成高维度向量,再通过解码器将高维度向量解码获得目标端序列。在这一过程中,各类信息皆表示为高维度向量,很难直观地去解释编码器与解码器的工作,例如:

(1)编码器是否能够从源端序列中捕获源端语义信息?

(2)如果编码器能够捕获源端语义信息,那么捕获的是何种语义信息?对下游任务是否有帮助?

(3)如果为编码器提供更多的语义信息,是否能够提升神经机器翻译的性能?

本文的工作侧重于回答上述三个问题。特别地,本文使用了抽象语义表示(abstract meaning representation, AMR)[5]作为语义信息的表示载体。AMR是近些年来备受关注的一种语义表示方法,其把自然语言文本以句子为单位,将句子的语义抽象表示为单根有向无环图。如图1(c)所示,句子中lost和our等词分别被映射 “lose-02”和“we”等AMR图中节点,这类节点被称为概念(concept)。连接概念之间的边,如图1中“:ARG1”和“:manner”等表示两个概念之间有向的语义关系。如图1中(d)所示,AMR图文本表示中“~e.N”等表示概念、边与源端序列中第N个词所对齐(从第0个词开始计数),如“bitter~e.0”表示“bitter”与源端序列中第0个词“Bitterly”对齐。“w”等变量表示指示引用节点,如“l”指向“lose-02”。需要注意的是,目前AMR还无法做到表述句子的完整语义。AMR侧重的是描述某个句子内部存在的概念(concept),以及它们之间的语义关系,但同时忽略了时态、名词单复数等信息。……

登录APP查看全文

猜你喜欢

语义单词信息
语言与语义
看图填单词
订阅信息
看完这些单词的翻译,整个人都不好了
“上”与“下”语义的不对称性及其认知阐释
认知范畴模糊与语义模糊
展会信息
语义分析与汉俄副名组合
单词拾趣
健康信息