构建大规模的汉语事件知识库
2012-06-29王俊俊陈丽欧
中文信息学报 2012年3期
周 强,王俊俊,陈丽欧
(1. 清华大学 信息技术研究院 语音和语言技术中心,北京 100084;2. 清华信息科学与技术国家实验室,北京 100084;3. 清华大学 计算机科学与技术系,北京 100084)
1 引言
随着互联网的迅猛发展,大量的信息以文本的形式快速涌现。如何从海量的文本中准确抽取到所需要的信息,已经成为研究的热点问题。
对海量文本进行信息的深度挖掘离不开高质量的事件内容分析技术,而这些技术的开发又需要高质量的事件语义标注资源支持。近几年来,英语方面陆续启动了多个大规模的事件语义资源开发项目,如FrameNet[1]、OntoNotes[2]等,它们分别从不同角度对英语真实文本句子中的事件语义信息进行了深度标注。在这些项目的推动下,事件语义资源的开发取得了长足的进展和丰硕的成果。相对而言,汉语的事件语义资源开发还很薄弱,需要进行大量工作。
针对汉语的研究现状,结合汉语自身的特点,我们设计并实现了一个针对汉语客观事件的句法、语义和概念描述知识库——汉语事件知识库。该项目得到了国家863计划课题的支持,由北京大学、鲁东大学和清华大学协作开发完成。
在一个统一的设计框架下,我们将相关事件知识描述拆分成五个子库,包括两个静态库、两个动态库以及一个用于在两大知识库之间建立联系的动词义项对齐知识库。五个子库相互配合,互为补充,为汉语文本的事件内容分析提供了丰富的语义资源支持。初步的实验结果显示,这个方案可以很好地解决事件知识库的“可操作性,可计算性,可扩展性”问题。……
登录APP查看全文
