基于词语搭配关系的一种中文分词歧义性消除方法
2016-11-08郭丙华俞亚堃李中华
计算机应用与软件 2016年10期
郭丙华 俞亚堃 李中华
1(肇庆学院电子信息工程系 广东 肇庆 526061)2(中山大学信息科学与技术学院 广东 广州 510006)
基于词语搭配关系的一种中文分词歧义性消除方法
郭丙华1俞亚堃1李中华2
1(肇庆学院电子信息工程系广东 肇庆 526061)2(中山大学信息科学与技术学院广东 广州 510006)
汉语中词与词之间存在固定的搭配关系,基于词语搭配关系提出一种分词歧义性消除方法。该方法先利用正向和逆向最大匹配方法进行句子预切分,并对词的歧义性进行检测和词性标注,再对歧义词与词语搭配词典进行匹配或者动宾搭配判断,实现了较为准确的文档词语歧义性消除。通过词的歧义性检测实验和词语搭配检测对比实验,该方法取得了较好的效果。
词语搭配最大匹配中文分词歧义性动宾搭配
ACHINESESEGMENTATIONDISAMBIGUATIONMETHOD
0 引 言
中文分词技术是中文文本信息自动处理诸如汉语语言理解、机器翻译与服务、自动分类、搜索引擎等关键技术之一[1],但由于机器自动分词的缺陷和中文的特殊性,其效果远远达不到人对中文的理解程度。现有的常用分词算法主要有以下两类:
(1) 最大匹配方法[2]
最大匹配算法是一种基于词典的机械分词算法,其包括正向匹配和逆向匹配两种方法以及这两种方法的一些改进[3,4]。这些方法主要从句头或句尾开始进行词的扫描并与词典匹配,匹配成功则在此位置进行切分。由于最大匹配算法实现简单、分词速度快的特点,使其成为应用最为广泛的一种分词方法。……
登录APP查看全文
