APP下载

融合被动和可能态模型的日汉统计机器翻译

2016-06-01徐金安陈钰枫张玉洁

中文信息学报 2016年6期
关键词:规则分类特征

王 楠,徐金安,明 芳,陈钰枫,张玉洁

(北京交通大学 计算与信息技术学院,北京 100044)

融合被动和可能态模型的日汉统计机器翻译

王 楠,徐金安,明 芳,陈钰枫,张玉洁

(北京交通大学 计算与信息技术学院,北京 100044)

日语中谓词语态有不同的词尾变形,其中被动态和可能态具有相同的词尾变化,在统计机器翻译中难以对其正确区分及翻译。因此,该文提出一种利用最大熵模型有效地对日语可能态和被动态进行分类,然后把日语的可能态和被动态特征有效地融合到对数线性模型中改进翻译模型的方法,以提高可能态和被动态翻译规则选择的准确性。实验结果表明,该方法可以有效提升日语可能态和被动态句子的翻译质量,在大规模日汉语料上,最高翻译BLEU值能够由41.50提高到42.01,并在人工评测中,翻译结果的整体可理解度得到了2.71%的提升。

被动态;可能态;统计机器翻译;最大熵模型

1 引言

日语的“态”是一种语言现象,指在谓语后加接尾辞,且补充语的格规则也相应发生变化的情况。被动态与可能态是日语语态中的两种典型形式。表示主体受到另一事物的动作时使用动词的被动态,而在表示主体具有某种能力、有条件进行某种行为时,使用动词的可能态。这两种语态多数情况是由动词的未然形后加词尾 “れる”“ られる”构成的。例如,“吃”在日语中对应的动词未然型是“食べる”,其语态变化如表1所示。

现有研究大部分从语义及结构上进行日语被动态与可能态的区分[1]。……

登录APP查看全文

猜你喜欢

规则分类特征
撑竿跳规则的制定
数独的规则和演变
分类算一算
如何表达“特征”
不忠诚的四个特征
让规则不规则
教你一招:数的分类
TPP反腐败规则对我国的启示
线性代数的应用特征