汉语-维吾尔语的一对一词对齐研究
2012-11-14张亚军贺琛琛
昌吉学院学报 2012年6期
张亚军 贺琛琛
(1.昌吉学院计算机工程系 新疆 昌吉 831100;2.昌吉学院人事处 新疆 昌吉 831100)
1 引言
词语的对齐(简称词对齐,Word Alignment)研究是自然语言处理的一个重要组成部分,词对齐分为三类:一对一、多对一、多对多。其目的是要找出从源语言的字符串和目标语言的字符串之间的词对齐。词对齐对于平行语料库、语料数据挖掘等方面尤为重要。同时,词对齐还可以为双语词典、语音识别、信息检索提供源材料。英语和汉语词对齐研究相对成熟,基本精度在90%以上,取得的召回率约88%。然而汉语-维吾尔语(简称汉维)词对齐的研究,处于前期研究阶段。
研究词对齐方法主要有两类:
(1)基于语言学的方法:充分使用各种语言学的资源进行词对齐研究。例如利用统计和词典相结合的方法进行的词对齐[1];或者利用语言学比较的方法进行词对齐等[2]。
(2)基于统计的研究方法:其思路是通过对平行语料库的统计性训练,取得双语对应词的同现概率作为词对齐的基础,主要方法有Brown提出的基于信源信道模型方法实现的词对齐[3];Dagan等人对Brown的模型进行改进的词对齐[4];Gale、Piao、Okita都使用互信息和X2检验方法进行词对齐[5][6][7]等。
基于统计方法实现汉维一对一的词对齐是本文研究的重点内容。
2 词对齐模型描述
2.1 基于信源信道模型的统计方法
信源信道思想应用于统计机器翻译,实际上可以理解为一个解码的过程,此时把翻译系统视为信源信道,即对于一个目标语言字串S,将寻找一个最大可能的源语言句子T,搜索概率P(T|S)最大值的过程。……
登录APP查看全文
