基于熵的机器翻译伪并行语料库选择方法
2021-09-09刘婉月艾山吾买尔敖乃翔郭锐
现代计算机 2021年19期
刘婉月,艾山·吾买尔,敖乃翔,郭锐
(1.新疆大学信息科学与工程学院,乌鲁木齐 830046;2. 新疆大学新疆多语种信息技术实验室,乌鲁木齐 830046;3. 中国电子科技集团公司电子科学研究院,北京 1000414. 新疆联海创智信息科技有限公司,乌鲁木齐 830010)
0 引言
由于缺乏大规模并行语料使NMT模型无法达到所需的性能[1],导致低资源语言的机器翻译任务困难重重。为了解决这个问题,出现了许多创新技术。迄今为止,最成功的方法是Sennrich等人的方法[2],通过反向翻译将单语目标文本转换为伪造并行数据。此后,该技术已在许多后续研究中被证明是有效的,但大多数研究仅使用BT的所有数据来提高NMT模型的质量。在资源匮乏的环境中,低资源下很难训练高性能的反向翻译模型,因此使用全部的BT数据效果并不好[3],合理适当地选择BT数据子集更能有效提高模型的翻译质量。因此,确定最佳质量的BT数据子集是一个值得探索的问题。
1 相关工作
为了解决低资源问题,先前的研究学者们提出了很多不同的方法扩充平行语料。在不修改NMT翻译模型的条件下,通过前向翻译将大量的源端单语数据翻译成目标语言,构造大规模伪造语料库[4-5]。使用目标端单语数据进行平行语料的扩充,置源端为空,单语数据放置在目标端联合真实平行语料训练翻译模型[6]。和前向翻译完全相反,使用目标单语数据反向翻译成源端数据,构造伪造平行语料库[7]。将单语数据同时放置在源端和目标端联合真实平行语料训练模型[7-8]。……
登录APP查看全文
