面向形态丰富语言的多粒度翻译融合
2011-06-28王志洋吕雅娟
中文信息学报 2011年4期
王志洋,吕雅娟,刘 群
(1. 中国科学院 计算技术研究所, 中国科学院 智能信息处理重点实验室,北京 100190;2. 中国科学院 研究生院,北京 100049)
1 引言
形态丰富语言的主要特征是高度丰富的形态变化,像曲折(Inflection)、派生(Derivation)、复合(Composition)等。给定一个词根,通过形态变化可以衍生出成百上千种新的形式;例如蒙古语词根UILED,理论上至少可以有1 710种变化形式[1]。如果将每一种变化形式都看作单独的词,这会大大增加词汇量,导致语言模型参数估计的不可信,并提高未登录词(Out-Of-Vocabulary, OOV)的比例。对统计机器翻译而言,这种数据稀疏现象会严重影响词语对齐和翻译的质量。这类语言给自然语言处理,尤其是机器翻译带来了巨大的挑战。
我国是一个多民族国家,很多少数民族都有自己的语言文字,并在本民族的各个领域中广泛应用。使用较多的少数民族语言,像维吾尔语、蒙古语、哈萨克语等都属于形态丰富语言。研究这些少数民族语言与汉语之间的翻译,对加强民族之间的沟通交流、文化传播、经济发展有重要的意义。而在与中国海陆相邻的二十一个国家中,除中国南部的极少数国家(像越南、缅甸、老挝等),大部分国家使用的语言都有丰富的形态变化,像俄语、日语、韩语等。通过研究这些语言与汉语之间的翻译,对维护地区稳定、促进交流合作等有重要作用。
本文主要研究形态丰富语言到汉语的翻译。由于这类语言形态变化复杂,而且双语资源相对匮乏。为了充分利用有限的双语语料,缓解数据稀疏问题,本文将这类语言表示为不同的粒度,并分别进行翻译,然后利用系统融合技术将不同粒度的翻译结果进行融合,以提高机器翻译的性能。……
登录APP查看全文
