多领域中文依存树库构建与影响统计句法分析因素之分析
2015-04-21邱立坤史林林王厚峰
中文信息学报 2015年5期
关键词:差异
邱立坤,史林林,王厚峰
(1.鲁东大学 文学院,山东 烟台 264025;2. 北京大学 计算语言学研究所,北京 100871)
多领域中文依存树库构建与影响统计句法分析因素之分析
邱立坤1,史林林1,王厚峰2
(1.鲁东大学 文学院,山东 烟台 264025;2. 北京大学 计算语言学研究所,北京 100871)
为提升依存分析并分析影响其精度的相关因素,该文构建了大规模中文通用依存树库和中等规模领域依存树库。基于这一系列树库,通过句法分析实验考察质量、规模、领域差异等因素对中文依存分析的影响,实验结果表明: (1)树库规模和质量均与句法分析精度成正相关关系,质量应先于规模因素被优先考虑;(2)通用树库和领域树库之间的差异程度与前者对后者的替代性成相关关系;(3)两种树库混合使用的效果同样与领域差异有关。
依存树库;领域迁移;依存句法分析
1 引言
依存句法分析的目标是为给定句子中的每个词找出一个合适的父节点,并标记子节点与父节点之间的句法关系,它是目前最常用的句法分析理论之一。作为主流依存分析方法的统计句法分析,通常用包含大量依存句法树的树库作为训练数据,采用基于图的方法[1]或基于转移的方法[2]训练,可得到面向新闻文本的高质量自动句法分析器。依存句法分析已在机器翻译、自动问答、情感分析等领域得到广泛应用,可在一定程度上提升相关系统的性能。但是,统计句法分析性能依赖于树库的规模、质量,并且表现出领域相关性,在迁移到新领域时精度急剧下降[3]。……
登录APP查看全文
