APP下载

基于枢轴语言的汉越神经机器翻译伪平行语料生成*

2021-04-06贾承勋余正涛文永华于志强

计算机工程与科学 2021年3期
关键词:语言方法模型

贾承勋,赖 华,余正涛,文永华,于志强

(1.昆明理工大学信息工程与自动化学院,云南 昆明 650500;2.昆明理工大学云南省人工智能重点实验室,云南 昆明 650500)

1 引言

神经机器翻译NMT(Neural Machine Translation)是目前机器翻译领域的热点研究方法,相较于统计机器翻译SMT(Statistical Machine Translation)[1],神经机器翻译在大量的平行句对上取得了更好的翻译效果[2,3],但是神经机器翻译在平行语料匮乏的低资源环境下,效果并不理想[4]。为缓解语料缺乏困境,早期研究者们利用人工标注方式扩充语料,然而人工标注具有周期长、成本高的缺点,因此研究者们开始关注语料的自动扩充方法[5]。汉语-越南语是典型的低资源语言对,汉越神经机器翻译同样面临数据稀缺问题[6],这一问题严重影响神经机器翻译在实际中的应用,因此如何通过语料扩充手段改善汉越神经机器翻译的性能是值得研究的问题。

目前通过生成伪平行数据缓解数据稀疏问题,是低资源神经机器翻译的一个重要研究方向[7]。对于伪平行数据扩充的研究,目前主要有2种方式:抽取式和生成式。抽取式是根据一定规则从可比语料、枢轴语料或者2种语言的单语语料中抽取伪平行语料[8 - 11];生成式是在已有小规模平行语料的前提下,通过词的替换、单语数据回译[12]和建立枢轴模型等方法,生成更多的伪平行数据[12 - 14]。

目前基于生成式的伪平行数据扩充方法的有效性已经得到了充分验证,但缺少对这些方法融合利用方面的研究。

因此,本文针对汉越神经机器翻译任务,对基于词的替换、单语数据回译和基于枢轴语言3种生成式方法的融合利用进行研究。……

登录APP查看全文

猜你喜欢

语言方法模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
语言是刀
让语言描写摇曳多姿
3D打印中的模型分割与打包
用对方法才能瘦
四大方法 教你不再“坐以待病”!
我有我语言
捕鱼