依存约束的图网络实体关系联合抽取①
2021-03-19任鹏程侯召祥
任鹏程,于 强,侯召祥
(中国石油大学(华东)计算机与技术科学学院,青岛 266580)
信息抽取是从自然语言中提取出特定需求信息的过程,例如从医疗文档中提取疾病名称,疾病原因、药物名称信息,或者从新闻文本中提取时间、地点、人物信息等,从而对文本数据进行分类、提取、重构.其中关键任务之一就是提取形为SPO (Subject,Prediction,Object)的实体关系三元组,从而将无结构数据转换为结构化的可用形式.
传统上实体关系抽取使用Pipeline 方式,即首先通过命名实体识别模型提取实体,然后对提取的实体进行关系分类.Pipeline 形式简单、操作灵活,但是任务的级联特性会导致模型误差的累积,命名实体识别模型的错误预测会传播到关系抽取模型,影响关系分类任务的性能.同时在关系分类任务前,需要对命名实体识别的结果进行实体对的两两配对,如果匹配的实体对本身不存在关系则产生“噪声”,引起模型错误率及计算复杂度的增加.联合抽取即将命名实体识别模型和关系分类模型合并为一个模型进行统一建模,考虑两个任务之前潜在关联,以此削弱级联误差传播影响,文本中所有实体、实体与关系、关系与关系的交互信息学习的越多,联合模型的效果就会越好.
关系抽取还面临重叠关系的挑战,即实体间存在多种对应方式,一对多或者多对多等情况,例如“Quebec,Canada’s second most populous province,after Ontario,has not decided to go that far.”,包含3 个实体关系三元组 (Ontario,country,Canada)、(Canada,Contains,Ontario)以及(Canada,administrative_divisions,Ontario),其中(Canada,Ontario)实体对对应两个关系,预测时就会面临只预测出一种关系的情况.重……
