事件信息结构分析
2012-06-29杨尔弘曾青青李婷婷
中文信息学报 2012年3期
杨尔弘, 曾青青, 李婷婷
(1. 北京语言大学 国家语言资源监测与研究中心 平面媒体语言分中心,北京 100083;2. 首都体育学院 国际教育学院,北京 100191)
1 引言
随着互联网的广泛应用,准确地从海量、无序、杂乱、无结构的网页文本中提取用户感兴趣的事件信息是信息抽取领域的重要研究课题[1]。在美国,DARPA,NIST组织的MUC、ACE[2-4]等评测任务中,对事件信息抽取给出了明确的定义。当前的事件抽取研究,大多以这样的定义为基础:以若干特定的事件类型为目标,研究事件模板的获取以及事件的论元识别[5-10]。事件模板主要依靠经验给出种子模板或聚类的方式获取[5-7,10-12];论元角色多以计算事件模板论元的语义约束与词语的相关属性之间的对应关系进行填充[6,12]。
目前,从整个语篇的角度探索事件信息的分布与事件抽取技术的研究还较少。文献[7]尝试了从语篇中过滤非事件句子,文献[13]探索了语篇中事件与事件的关系,研究事件之间的推理。
本文针对突发事件新闻报道,从可操作的角度,将“事件”定义简单化——与突发事件相关的动作、状态改变都定义为一个事件,事件以事件词为标示,事件词可以是动词、名词化(Nominalizations)、形容词等。在此基础上,研究事件信息在报道文本中的分布,从而确定文本中事件信息的组织方式,寻找到篇章结构和事件信息结构之间存在的联系,为事件信息的形式化描述和准确定位服务。
2 突发事件文本的篇章结构和事件信息结构
2.1 事件信息在篇章结构中的分布调查
戴伊克(Van Dijk)在《作为话语的新闻》[16]一书中概括了新闻文本的假设性话语结构图式,如图1所示。……
登录APP查看全文
