基于藏语字性标注的词性预测研究
2015-04-21龙从军刘汇丹诺明花
中文信息学报 2015年5期
关键词:模型
龙从军,刘汇丹,诺明花,吴 健
(1. 中国科学院软件研究所,北京 100190;2. 中国社会科学院民族学与人类学研究所,北京 100081)
基于藏语字性标注的词性预测研究
龙从军1,2,刘汇丹1,诺明花1,吴 健1
(1. 中国科学院软件研究所,北京 100190;2. 中国社会科学院民族学与人类学研究所,北京 100081)
该文选取了藏语文中小学教材的部分语料,构建了带有藏语字性标记、词边界标记和词性标记的语料库,通过比较不同的分词、标注方法,证明分词、词性标注一体化效果比分步进行的效果好,准确率、召回率和F值分别提高了0.067、0.073和0.07。但词级标注模型难以解决词边界划分的一致性和未登录词的问题。基于此,作者提出可以利用字性和字构词的规律预测合成词的词性,既可以融入语言学知识又可以减少由未登录词导致的标注错误,实验结果证明,作为词性标注的后处理模块,基于字性标注的词性预测准确率提高到了0.916,这个结果已经比分词标注一体化结果好,说明字性标注对纠正词性错误标注有明显的效果。
藏语; 语字标注; 分词; 词性标注
1 藏语词性标注的现状和问题
词性标注研究指为给定句子中的每个词确定一个合适的词性的过程。词性标注研究是自然语言处理基础研究内容之一,在语音识别、信息检索等很多领域发挥着重要的作用。
藏语词性标注研究已经取得了一些成果,文献[1]采用隐马尔科夫模型,实现分词和词性标注一体化,最终词性标注的F值达到79.494%;文献[2]采用了融合语言特征的最大熵词性标注模型,标注准确率达到90.94%;……
登录APP查看全文
