基于“固结词串”实例的中文分词研究
2012-06-29修驰,宋柔,2
中文信息学报 2012年3期
关键词:方法
修 驰,宋 柔,2
(1. 北京工业大学 计算机学院,北京 100022;2. 北京语言大学 语言信息处理研究所,北京 100083)
1 引言
解决中文分词问题的方法主要分为两类:基于词(或词典)的方法,例如,基于规则的最大匹配方法[1]、基于统计的词的N元语法的方法[2]。基于字的方法,例如,基于最大熵模型(ME)[3]、基于条件随机场模型(CRF)[4]的中文分词方法。
分词歧义和未登录词(OOV)一直是影响中文分词效果的两大因素。Bakeoff 2005的语料库统计数据说明未登录词造成的分词精度失落比歧义切分造成的精度失落至少大5倍以上[5]。基于CRF模型的字标注分词方法在训练语料与测试语料同质的情况下可以较好的解决OOV问题,在近几年的bakeoff中都取得了很好的成绩。但是歧义切分错误仍然是汉语分词中不可忽视的问题,CRF模型对歧义切分问题的解决并不够好,而且这一方法开销大、不灵活。有人采用规则加实例库的办法消除分词歧义[6]。但这种方法需要人工构建规则与实例库,只能解决有限语言现象,难以适用于各种不同的语料。因此,希望找到一种专用于中文分词的机器学习方法,既可以吸收基于字的分词方法的优点,充分挖掘训练语料中的分词信息,又不需要太长的训练时间得到较好的分词结果。
本文从CRF在分词歧义上存在的问题入手,提出了基于“固结词串”词表分词的方法,即一种基于实例的中文分词方法。利用固结词串可以简化机器学习过程,充分利用训练语料中的知识。本文组织方式如下:第二节分析CRF中文分词方法存在的问题;……
登录APP查看全文
