基于熵模型的英汉人名对齐
2016-05-04刘颖曹项
中文信息学报 2016年3期
刘颖,曹项
(清华大学 中文系,北京 100084)
基于熵模型的英汉人名对齐
刘颖,曹项
(清华大学 中文系,北京 100084)
该文使用熵模型来对中英文双语语料进行人名对齐。熵模型综合利用双语人名词典、双语姓氏词典、词汇对齐概率、中英文人名的共现特征、基于最小编辑距离的音译相似度和基于语音匹配的音译相似度。实验结果表明,基于熵模型的中英文人名对齐在大规模语料库的实验中达到了较好的人名对齐正确率和召回率。我们分析了人名对齐存在的主要错误,并针对主要错误给出了可能的解决方案。
人名对齐;熵模型;音译相似度; 最小编辑距离;词典
1 引言
中英文命名实体对齐尤其是人名的对齐一直是自然语言处理中一个非常重要的课题,它对于机器翻译、跨语言信息检索的发展具有重要作用[1]。
目前,基于双语语料库的命名实体对齐主要有基于音译的方法、基于双语平行语料库的方法和基于双语可比较语料库的方法。
基于音译的统计首先从双语语料库中对齐的命名实体对或双语词典中学习带有概率的音译规律,然后利用学习的知识对新的命名实体进行排序,从而产生最优翻译。基于音译的统计方法把一种语言的命名实体A翻译到另一种语言命名实体B的主要思路是: 首先把命名实体A转换成其发音,然后把A发音转换成B的发音,再把B发音转换成命名实体B。Kevin Knight[2]把英语命名实体翻译成日语的命名实体。首先把英文短语转换成英文发音序列,然后把英文发音序列转换成日文发音序列,再把日文发音序列转换成日文片假名。……
登录APP查看全文
