APP下载

基于层叠CRF模型的词结构分析

2015-04-21周国栋

中文信息学报 2015年4期
关键词:结构分析模型

方 艳,周国栋

(苏州大学 自然语言处理实验室,江苏 苏州 215006;苏州大学 计算机科学与技术学院,江苏 苏州 215006)



基于层叠CRF模型的词结构分析

方 艳,周国栋

(苏州大学 自然语言处理实验室,江苏 苏州 215006;苏州大学 计算机科学与技术学院,江苏 苏州 215006)

传统的中文分词就是识别出每个词的边界,它忽略了汉语中词与短语分界不清这一特点。在理论上,语言学家对词边界的确定往往各持己见,各语料库的分词标准不能统一,在实践中也不能完全满足具体应用的需求。该文给出了基于层叠CRF模型的词结构自动分析方法,能够以较高的精确度获得词的边界信息和内部结构信息。相比于传统的分词,词的结构分析更加符合汉语词法与句法边界模糊的事实,解决了语料库标准的不一致性以及应用的不同需求。

中文分词;内部结构;分词标准;层叠CRF

1 引言

中文分词是中文自然语言处理中最基本的一个步骤,其出发点是希望汉语的后续处理过程(如句法和语义分析)跟英语等西方语言基本一致,但汉语中词与短语间的界限往往难以划清,这就导致实践中人工标注的分词语料存在严重的不一致性,这种不一致性无疑会制约汉语的后续处理工作。

分词语料的不一致性不仅体现在不同语料库间分词标准不同,而且同一语料库中的分词标准也不一致。其主要原因是从认知角度来看“词”的概念本身就是模糊的,因而不同的人对“词”的概念有着不同的理解。……

登录APP查看全文

猜你喜欢

结构分析模型
一半模型
《形而上学》△卷的结构和位置
隐蔽失效适航要求符合性验证分析
重尾非线性自回归模型自加权M-估计的渐近分布
论结构
电力系统不平衡分析
电力系统及其自动化发展趋势分析
论《日出》的结构
3D打印中的模型分割与打包
创新治理结构促进中小企业持续成长