多跳机器阅读理解研究进展
2021-09-15黄瑞阳张建朋余诗媛
计算机工程 2021年9期
苏 珂,黄瑞阳,张建朋,余诗媛,胡 楠
(1.郑州大学 软件学院,郑州 450001;2.国家数字交换系统工程技术研究中心,郑州 450002)
0 概述
机器阅读理解(Machine Reading Comprehension,MRC)是一项使机器能够理解文本篇章段落语义内容并回答人类相关问题的技术。MRC 可以帮助人类从海量文本中快速聚焦相关主题,显著提升人类获取信息的效率,因此,其在文本理解、信息抽取、对话系统等领域具有极高的应用价值。近年来,随着深度学习快速发展,机器智能化水平大幅提升,一些大规模MRC 数据集被陆续发布,基于深度学习的MRC 技术开始进入人们的视野。与传统MRC 模型相比,基于深度学习的MRC 模型使用神经网络结构,能够更好地挖掘文本的上下文语义信息,在文本理解和智能问答中表现更为出色,甚至超越了人类水平。因此,该技术受到工业界和学术界的广泛关注,被认为是实现通用人工智能的重要支撑。
根据答案的形式,常见的MRC 任务可分为完形填空式、多项选择式、片段抽取式、自由回答式等4 类[1],其中,完形填空式和多项选择式是考试试题中的常见题型,数据收集相对简单,这两类任务通常采用浅层语义匹配或多分类模型解决。自由回答式阅读理解形式多样且难度大。相比而言,片段抽取式阅读理解难度适中,且有高质量的数据集支撑,其作为文本问答、信息抽取等领域的基础任务,具有较高的研究价值,因此也受到更多关注。然而,现有的抽取式阅读理解模型和相关数据集大多限定答案仅由单个文本中单个片段组成,这在很大程度上限制了当前MRC 模型的实际应用[2]。……
登录APP查看全文
