APP下载

融合词性语义扩展信息的事件检测模型

2024-03-21严海宁余正涛黄于欣宋燃杨溪

计算机工程 2024年3期
关键词:语义实验信息

严海宁,余正涛*,黄于欣,宋燃,杨溪

(1.昆明理工大学信息工程与自动化学院,云南 昆明 650504;2.昆明理工大学云南省人工智能重点实验室,云南 昆明 650504)

0 引言

事件检测(ED)是事件抽取的关键步骤,目标是在给定句子中识别事件触发词并将其分类为预定义的事件类型。触发词是最能清楚表达事件核心含义的词,通常是一个名词或者动词[1]。事件检测作为自然语言处理领域的一项重要任务,被广泛应用于知识图谱[2]、自动内容抽取[3]等下游任务。

事件检测任务依赖于识别出的触发词进行事件类型分类[4-5]。现有多数数据中触发词的标注严重不平衡,使模型过度拟合密集标注的触发词数据,而稀疏标记的触发词数据往往得不到有效训练,导致触发词为稀疏标记或未出现过的词时模型性能不佳。

在以下句子S1、S2 中有下划线的词语表示触发词:

S1:EU will release 20 million euros in emergency humanitarian aid to Iraq.

S2:EU will disburse 20 million euros in emergency humanitarian aid to Iraq.

可以看出,在句子S1 中,密集标注触发词数据“release”被模型正确识别后,句子被分类为正确的事件类型“Transaction:Transfer-Money”,而在将句子S2 中密集标注触发词“release”替换为稀疏标记的同义触发词“disburse”后,不改变句子原本表达的含义,模型却不能识别出正确的事件类型。

针对以上问题,现有研究认为生成更多的训练实例是一种解决方案。一些方法通过引导扩展出更多的训练实例[6-8],另一些方法使用更多数据进行远程监督[9-11]。但是这些方法要么生成同质的语料库,要么受制于低覆盖率的知识库,导致数据本身分布不均,训练的模型存在内置偏差[12],且在稀疏标记数据上性能仍然较差。……

登录APP查看全文

猜你喜欢

语义实验信息
记一次有趣的实验
语言与语义
做个怪怪长实验
订阅信息
NO与NO2相互转化实验的改进
实践十号上的19项实验
“上”与“下”语义的不对称性及其认知阐释
认知范畴模糊与语义模糊
展会信息
语义分析与汉俄副名组合