APP下载

统计机器翻译中实例短语对研究

2016-10-12李强李沐张冬冬朱靖波

北京大学学报(自然科学版) 2016年1期
关键词:特征实验方法

李强 李沐 张冬冬 朱靖波



统计机器翻译中实例短语对研究

李强1,†李沐2张冬冬2朱靖波1

1.东北大学自然语言处理实验室, 沈阳 110819; 2.微软亚洲研究院, 北京 100080; †E-mail: liqiangneu@gmail.com

针对由于数据的稀疏性和双语数据规模的局限性造成的大量高质量短语对没有生成的问题, 在基于短语的统计机器翻译系统中, 通过对传统短语抽取算法抽取的短语对进行分解、替换、生成等操作, 生成传统方法无法抽取的实例短语对。在汉英新闻和汉英口语翻译任务上, 与基线系统相比, 该方法在多个测试集上明显提高了翻译系统的翻译质量, 在部分测试集上BLEU值可提高1%左右。

统计机器翻译; 基于短语; 基于实例; 短语对

基于短语的统计机器翻译模型具有原理简单、性能优异、鲁棒性高等诸多特点, 受到研究与应用人员的广泛青睐, 在当今真实的翻译任务中得到广泛应用[1-2]。短语翻译系统使用短语对作为翻译的基本单元, 传统的启发式短语对抽取算法抽取所有与词对齐保持一致的短语对[3]。基于统计的机器翻译方法建立在大规模双语及单语语料的基础上。然而, 在当今真实的翻译任务中, 许多翻译任务(如口语翻译任务)并没有充足的双语语料用于抽取高质量的短语对。由于数据的稀疏性、双语数据规模的局限性以及词对齐的错误和与词对齐保持一致规则的约束, 大量有用的、高质量的短语对没有生成, 导致待翻译源语言句子中很多短语片段没有直接对应的翻译结果, 只能在翻译解码的过程中, 通过组装颗粒度较小的短语对进行译文的生成。……

登录APP查看全文

猜你喜欢

特征实验方法
记一次有趣的实验
如何表达“特征”
做个怪怪长实验
不忠诚的四个特征
NO与NO2相互转化实验的改进
实践十号上的19项实验
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼
线性代数的应用特征