树库中的歧义组合考察
2012-06-29李艳娇杨尔弘
中文信息学报 2012年2期
关键词:语义
李艳娇, 杨尔弘
(北京语言大学 应用语言学研究所,北京 100083)
1 引言
树库作为包含语言结构信息的资源,其价值与作用得到了人们的肯定。“首先,它可为基于统计的自动句法分析器提供必要的训练数据和统一的测评平台;其次,它能为汉语句法学研究提供真实文本标注素材,便于语言学家从中总结语言规则和规律;第三,它是进一步进行句子内部的词语义项和语义关系标注的基础[1]。”
组合歧义是指一个句法结构可以对应多种组合方式,即对应多棵树。对于计算机而言,要在多个结构中选择一个合适的句法结构,需要各种知识,通常统计的训练模型主要利用的是一种结构在特定环境中的概率分布知识。本文通过对树库语料中三元词性序列组合方式的统计,发现汉语中的歧义组合很大程度上要靠词语内部的语义关系来化解,上下文环境的句法信息作用甚小。
《汉语短语结构定界歧义类型分析及分布统计》[2]一文在一个汉英机器翻译系统所用的汉语分析规则的基础上,对汉语短语结构的定界歧义做了全面考察,从歧义格式的组成成分,歧义对外造成的影响,模式歧义和实例歧义的对应关系三方面考察了短语结构定界歧义的不同类型,并对汉语短语结构定界歧义的不同类型进行了初步统计,以期对汉语短语结构定界歧义问题做清晰化的描述。至于一个歧义格式跟具体歧义实例的对应关系,由于要跟实际语料使用相印证,需要大规模树库的支持,所以该文没有做统计。……
登录APP查看全文
