基于依存语法构建多视图汉语树库
2015-04-21邱立坤王厚峰
中文信息学报 2015年3期
邱立坤,金 澎,王厚峰
(1. 鲁东大学 文学院 山东省语言资源开发与应用重点实验室,山东 烟台 264025;2. 北京大学 计算语言学研究所,北京 100871;3. 乐山师范学院 智能信息处理及应用实验室,四川 乐山 614004)
基于依存语法构建多视图汉语树库
邱立坤1,2,金 澎2,3,王厚峰2
(1. 鲁东大学 文学院 山东省语言资源开发与应用重点实验室,山东 烟台 264025;2. 北京大学 计算语言学研究所,北京 100871;3. 乐山师范学院 智能信息处理及应用实验室,四川 乐山 614004)
树库是自然语言处理中一项重要的基础资源,现有树库基本上都是单视图树,支持短语结构语法或者依存语法。该文提出一套基于依存语法的多视图汉语树库标注体系,仅需标注中心语和语法角色两类信息,之后可以自动地推导出描述句法结构所需的短语结构功能和层次信息,从而可以在不增加标注工作量的前提下获得更多语法信息。基于该体系,构建了北京大学多视图汉语树库(PMT)1.0版,含有64 000句、140万词,支持短语结构语法和依存语法两个视图。
多视图树库;依存语法;短语结构语法
1 引言
树库是标注有句法信息的语料库,是一种深度标注的语言知识资源。在语料库语言学和计量语言学中,树库可以用于研究各种语法现象以及语言整体的特点;在计算语言学中,树库可以用于训练和测试句法分析器。20世纪90年代之前,自动句法分析主要使用规则的方法,通过大量人工总结的规则来进行句法分析。宾州树库[1]以及一系列类似句法树库的构建改变了这一局面。……
登录APP查看全文
