APP下载

基于深度交互融合网络的多跳机器阅读理解

2022-06-21朱斯琪王业相

中文信息学报 2022年5期
关键词:文本融合信息

朱斯琪,过 弋,2,3,王业相

(1. 华东理工大学 信息科学与工程学院,上海 200237;2. 大数据流通与交易技术国家工程实验室-商业智能与可视化研究中心,上海 200237;3. 上海大数据与互联网受众工程技术研究中心,上海 200072)

0 引言

近年来,随着互联网中新闻、电商等平台海量文本数据的产生,如何更好地理解文本从而提高机器的智能化水平,已经吸引了不少国内外学者的关注,而教会机器理解人类的语言也是目前自然语言处理领域最大的挑战之一。机器阅读理解,旨在让机器通过指定的上下文来回答问题从而实现对自然语言文本的理解。SQuAD[1-2]、RACE[3]、CoQA[4]、DuReader[5]等数据集的提出,使得模型在单跳机器阅读理解任务上的性能逐步提升,然而这些模型仍缺少在不同段落中寻找线索和聚集信息的能力。

与单跳机器阅读理解相比,多跳机器阅读理解需要从多个段落提及的实体中找到潜在的内部链接关系,提取与问题相关的线索,并对信息进行融合与分析,从而得到最终的答案。因此,多跳机器阅读理解是一项更具有挑战性的任务。目前,已经发布的多跳MRC数据集有Wikihop[6],ComplexWeb-Questions[7],HotpotQA[8]等。

本文实验基于HotpotQA数据集,数据样例如表1所示。该数据集每个样例包含1个问题与10个段落,其中仅有两个段落与问题相关,而其他8个段落与问题无关。它不仅需要模型从10个段落中筛选出与问题相关的两个段落,而且还要求模型能够在选出的两个段落中进行推理,从而获得问题的答案。此外,由于该数据集不依赖于外部的知识,因此需要模型泛化能力强,这为开放领域的问答打下了坚实的基础。……

登录APP查看全文

猜你喜欢

文本融合信息
村企党建联建融合共赢
融合菜
从创新出发,与高考数列相遇、融合
《融合》
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
订阅信息
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
展会信息
如何快速走进文本