APP下载

多注意力机制的藏汉机器翻译方法研究

2021-06-28刘赛虎珠杰

电脑知识与技术 2021年10期

刘赛虎 珠杰

摘要:互联互通时代了解和掌握不同语言的区域文化和信息十分重要,机器翻译是目前广泛应用的交流媒介。本文以藏汉机器翻译为研究对象,利用Transformer框架和模型,研究了基于Transformer多注意力机制的藏汉机器翻译方法。经过实验,评估了多语料融合实验、语料双切分实验对比效果,得到了BLEU值 32.6的实验结果。

关键词:藏汉;Transformer;机器翻译;注意力机制;多语料

中图分类号:TP399      文献标识码:A

文章编号:1009-3044(2021)10-0004-04

Abstract: It is very important to understand and master regional culture and information in different languages in the age of interconnection. Machine translation is a widely used communication medium. This paper takes Tibetan-Chinese machine translation as the research object, and uses the Transformer framework and model to study the Tibetan-Chinese machine translation method based on Transformermechanism. Through experiments, the comparison effect of multi-corpus fusion experiment and corpus double-segmentation experiment was evaluated, and the experimental results of BLEU 32.6 were obtained.

Key words: Tibetan-Chinese; Transformer; machine translation; attention mechanism; multilingual corpus

机器翻译(Machine Translation,MT)是借助机器的高计算能力,自动地将一种自然语言(源语言)翻译为另外一种自然语言(目标语言)[1]。藏文机器翻译技术经过了数十年的发展,已从传统基于规则、统计等机器翻译技术转变成基于神经网络架构的新技术,藏文机器翻译技术发展可分为基于规则的藏文机器翻译、基于统计的藏文机器翻译、基于神经网络的藏文机器翻译3个阶段。

早在21世纪初期就开始了藏文机器翻译技术,以基于规则的方法中,才藏太[2]结合词项信息和藏文语法规则,提出了以动词为中心的二分语法分析技术,基于此技术开发的藏文机器翻译系统具有词典、公文、科技三个方面翻译功能,其词典量达18.6万条,经评测分析,译文的可读性高达80%。

近年来基于统计方法的藏文机器翻译技术也得到了一定的发展,臧景才等[3]基于短语统计模型利用翻译训练工具Moses实现了藏汉的在线翻译系统。群诺等[4]提出了对基于中介语言词语翻译模型进行改进,融合基于中介语言的统计翻译模型和直接翻译模型到现有的训练过程中,改善统计机器翻译模型训练过程的盲目性、低效性、冗余性和表面性等缺陷的方法。……

登录APP查看全文