汉蒙统计机器翻译中的调序方法研究
2011-06-28王斯日古楞斯琴图那顺乌日图
王斯日古楞,斯琴图,那顺乌日图
(1. 内蒙古师范大学 计算机与信息工程学院,内蒙古 呼和浩特 010022;2. 内蒙古师范大学 网络中心,内蒙古 呼和浩特 010022; 3. 内蒙古大学 蒙古学学院, 内蒙古 呼和浩特 010021)
1 引言
关于汉蒙机器翻译,我们曾经做过基于规则的研究[1],基于实例的研究[2]和基于短语的统计方法研究[3]。汉语和蒙古语的语序有较大的差别,在基于短语的汉蒙统计机器翻译系统中,我们发现存在大量的语序错误。在基于短语的统计机器翻译系统的具体翻译结果中,对于两种语言中语序相同的句子,翻译效果较好。例如:
(1) 输入:这张汇款单,在哪里取款?
输出:ENE MONGGO G0BIGVLHV HAGVDASV,HAMIG_A J0G0S GARGAJV ABHV BVI ?

(2) 输入:今天天气怎么样?
输出:ONODOR-UN CAG AGVR-VN BAYIDAL YAMAR BVI ?

可见,以上两个句子中汉语和蒙古语句子语序基本上一样,翻译效果还不错。但是,对于那些语序不同的句子,翻译结果就没那么理想了,会出现大量的语序错误。例如:
(1) 输入:我想参加一个旅游团。
输出:BI 0R0LCAY_A GEJU B0D0JV NIGEN JIGVLCILAL-VN BOLHOM .

(2) 输入:我没有汤匙。
输出:UGEI BI NIGE HALBAG_A .

对于这两个译文,我们是没法接受的。其主要原因是译文语序不符合蒙古语句子的语序。这是由于汉蒙两种语言的语序差异较大,基于短语的翻译模型只能解决一些局部语序的调整。因此,我们考虑使用句法规则,在汉蒙统计机器翻译系统中进行调序。本文提出了基于蒙古语语序的汉语句子调序方法,此调序方法对基于短语的汉蒙统计机器翻译系统的NIST和BLUE值都有明显的提高。
2 基于蒙古语语序的汉语句子调序方法
基于短语的统计机器翻译只解决了短距离的局部调序,为了解决长距离调序,研究人员开始使用基于句法的调序方法。……
