远距离词性标注在电子病历上的研究
2017-06-21徐万民李燕辉
无线互联科技 2017年5期
关键词:处理
徐万民 李燕辉
摘要:词性标注是自然语言处理的一个重要组成部分,只有正确的标注才能使机器对自然语言理解准确。目前的词性标注系统只能对近距离的约束关系分析基本准确,若存在远距离约束关系,系统基本无法识别。文章基于最大熵模型和远距离搭配关系构建出的一种新的标注方法,可用于解决远距离标注可能产生的歧义。
关键词:自然语言;处理;词性标注;远距离标注
词性(Part of Speech,POS)是词汇基本的语法属性,通常也可称为词类。词性标注就是在给定句子中判定每个词的语法范畴,确定其词性并加以标注的过程。词性标注是自然语言处理中一项非常重要的基础性工作。词性标注作为连接分词与句法的中间步骤,它既能消除一部分由分词产生的歧义,也能为接下来的句法分析提供正确的分析帮助。
目前大部分统计语言模型是N-gram模型,其模型简单且有效,但是模型也存在缺陷。由于N值有限,模型只能处理短距离语言约束关系,不能有效处理长距离约束和语言递归现象,统计信息有时也不能反映真实的语言规律,这时,就会有歧义产生。
目前中文电子病历还处于空白期,针对中文电子病历的研究因为缺乏足够的语料,研究一直在缓慢地进行。相比于通用的语料库,电子病历存在标准不统一、各个医生的写作习惯不同、存在简写或包含专业词等情况。这些都无法依靠通用语料库来解决。
本文内容主要从以下几个方面展开:第2节主要介绍远距离词性标注的几种歧义;……
登录APP查看全文
