基于关联度的汉藏多词单元等价对抽取方法
2012-06-29诺明花刘汇丹丁治明
中文信息学报 2012年3期
关键词:模型
诺明花,刘汇丹,吴 健,丁治明
(1. 中国科学院 软件研究所,北京100190;2. 中国科学院 研究生院,北京 100049)
1 引言
长尾真(Nagao,M.)[1]提出:计算机辅助翻译的过程一般是首先将输入句子分解为片段,接着把这些片段译成目标语言,最后把这些片段合并成长句,其中每个片段采取类比的原则进行翻译。这些片段可以是词、短语或其他由多个词组合而成的语言单位,我们将这些语言单位统称为多词单元。多词单元是单词的扩展,单词和多词单元一起构成了翻译的基本单位。在汉藏翻译过程中,从翻译人员的实践来看,仅仅把词作为翻译的基本单位并不合适,将多词单元作为一个整体来翻译更能够保证译文的准确度和流利度,这种整体性的翻译对于提高全文翻译的质量是大有好处的。
本文将要构建汉藏辅助翻译系统的多词单元翻译词典,其中每条记录包含汉语有效多词单元以及对应的藏文译文。基于双语语料库进行翻译词典编纂,国内外很多研究者都做了大量工作[2-3]。在汉藏短语对抽取方面,国内已经有了一些研究。文献[4]中提出藏文词串频率统计算法(简称TSM)和藏文词串序列相交算法(简称TIA)两种方法进行汉藏短语对抽取。TIA算法使用藏文词序列相交短语译文获取模型(Sequence Intersection Based Phrase Translation Extraction Model,SIBPTM),对句对齐双语语料库中包含待翻译汉语语块的句对集合求交集来抽取译文。为了提高准确率,SIBPTM模型以汉藏词典为辅助资源,并设定阈值解决部分未登录现象。由于使用的汉藏双语词典覆盖率较低,未登录现象较突出,所以,这种方法能够抽取的短语对规模有限。……
登录APP查看全文
