基于依存树距离识别论元的语义角色标注系统
2012-06-29穗志方
中文信息学报 2012年2期
王 鑫,穗志方
(北京大学 计算语言学研究所,北京 100871)
1 引言
语义角色标注是浅层语义分析的一种重要手段,基于依存的语义角色标注将依存关系作为基本标注单元,对依存关系识别出的中心词进行语义角色标注。论元识别和论元分类是标注过程中需要解决的主要问题,而且都可以通过两类方法得以实现,基于统计的机器学习方法和基于规则的方法。
在基于依存的语义角色标注研究中,现阶段主要的论元识别方法都是基于机器学习的。本文通过对依存树中论元节点的特征分析,发现大于98%的论元节点到目标动词的依存树路径长度不超过3,这说明论元集中分布于依存树上的一个局部范围内。充分利用这一特点,本文参考赵海等[1]的剪枝算法,提出一种基于依存树距离的论元识别方法,通过制订规则,提取依存树中由动词的儿子、父亲、兄弟、第一祖父以及父亲的兄弟节点构成的候选论元集。在此识别方法基础上,本文采用机器学习的方法进行论元分类,综合原句的特征以及由识别所得候选论元构成的骨干句的特征,为候选论元标注相应的角色。在CoNLL2009中文语料上,以正确的依存树为输入,系统的F值达到89.46%,与前人的方法81.68%(王步康等[2])相比有很大改善。
2 相关研究
语义角色标注通常分为四个步骤,剪枝、识别、分类、后处理,而前三个步骤都是在完成广义分类任务,因为剪枝和识别本质都是区分候选对象是否会是论元。这种广义分类任务可以通过基于机器学习的方法和基于规则的方法来实现,不同系统的实现方法不同。……
登录APP查看全文
