APP下载

基于短语统计机器翻译模型蒙古文形态切分

2011-06-28应玉龙乌达巴拉

中文信息学报 2011年4期
关键词:词缀模型系统

李 文,李 淼,梁 青,朱 海,应玉龙,乌达巴拉

(1. 中国科学院 合肥智能机械研究所,安徽 合肥 230031;2. 中国科学技术大学 自动化系,安徽 合肥 230027;3. 大同电力高级技工学校,山西 大同 037039)

1 引言

形态切分的目标是将词切分为词素(词义基本单位,本文指的是词干、词缀的集合)。形态丰富的语言,例如蒙古语、土耳其语、俄语、西班牙语等,通常语言构形成分承载着大量的语法信息。形态切分成为自然语言处理中的很多领域,包括语音识别[1]、机器翻译[2-3]、信息检索[4]等重要研究方向,因而形态分析是蒙古文信息处理诸多应用系统的一个不可或缺的模块。

蒙古文形态分析属于序列标注问题,当前所采用的主要方法有: (1)词典和规则相结合的分析方法[5];(2)统计和规则相结合的分析方法[5]。基于词典的方法通过查词典的方式查到一个词是由哪些词干和词缀构成的,虽然对语料库中词切分准确率可以达到很高,但该方法受词典的规模限制且存在二义性问题。基于规则的方法主要依据专家总结规则,存在规则总结不完全、切分错误和切分二义性问题。基于统计和规则相结合的蒙古语形态切分方法[6],主要利用规则生成形态切分候选项,蒙古文词素统计语言模型作为排歧依据,分别有基于词性的语言模型和Skip-N语言模型,其正确率与基于规则和词典相结合的形态切分系统相比有较大的提高,然而该方法仍然受到规则的限制。

与上述方法不同,针对词表词切分存在二义……

登录APP查看全文

猜你喜欢

词缀模型系统
一半模型
Smartflower POP 一体式光伏系统
从网络语“X精”看“精”的类词缀化
WJ-700无人机系统
ZC系列无人机遥感系统
重尾非线性自回归模型自加权M-估计的渐近分布
连通与提升系统的最后一块拼图 Audiolab 傲立 M-DAC mini
释西夏语词缀wji2
3D打印中的模型分割与打包
试析否定词缀在汉维语中的不同表现