基于多特征融合和图匹配的维汉句子对齐
2016-05-03倪耀群许洪波程学旗
中文信息学报 2016年4期
倪耀群,许洪波,程学旗
(1. 中国科学院 计算技术研究所网络数据科学与技术重点实验室,北京 100190;2. 中国科学院大学,北京 100049;3. 洛阳外国语学院 语言工程系,河南 洛阳 471003)
基于多特征融合和图匹配的维汉句子对齐
倪耀群1,2,3,许洪波1,程学旗1
(1. 中国科学院 计算技术研究所网络数据科学与技术重点实验室,北京 100190;2. 中国科学院大学,北京 100049;3. 洛阳外国语学院 语言工程系,河南 洛阳 471003)
维吾尔语新闻网页与对应的中文翻译网页在内容上往往并非完全可比,主要表现为双语句子序列的错位甚至部分句子缺失,这给维汉句子对齐造成了困难。此外,作为新闻要素的人名地名很多是未登录词,这进一步增加了维汉句子对齐的难度。为了提高维汉词汇的匹配概率,作者自动提取中文人名、地名并翻译为维吾尔译名,构造双语名称映射表并加入维汉双语词典。然后用维文句中词典词对应的中文译词在中文句中进行串匹配,以避免中文分词错误,累计所有匹配词对得到双语句对的词汇互译率。最后融合数字、标点、长度特征计算双语句对的相似度。在所有双语句子相似度构成的矩阵上,使用图匹配算法寻找维汉平行句对,在900个句对上最高达到95.67%的维汉对齐准确率。
句子对齐;人名、地名翻译;多特征融合;二部图最佳匹配
1 引言
随着互联网的发展,多民族网络交流日益频繁和深入,迫切需要机器翻译和跨语言检索等工具的支持。双语语料是统计机器翻译、跨语言检索、双语词典构建等研究领域的重要基础资源。……
登录APP查看全文
