融合BERT语义表示的高考语文阅读理解问答研究
2022-06-21杨陟卓钱揖丽
中文信息学报 2022年5期
杨陟卓,韩 晖,张 虎,钱揖丽,李 茹,2
(1. 山西大学 计算机与信息技术学院,山西 太原 030006;2. 山西大学 计算智能与中文信息处理教育部重点实验室,山西 太原 030006)
0 引言
机器阅读理解的目标是让机器像人类一样阅读文本,提炼文本信息并准确回答相关问题。目前,机器阅读理解作为自然语言处理的核心领域,借助于深度学习技术获得了快速发展,成为学术界研究的焦点。
阅读理解从题型上划分可以分为选择题、填空题、问答题三大类型。其中,填空题的数据集代表有CNN/Daily Mail、汉语PeopleDaily/CFT等;选择题的数据集代表有MCTest、RACE等;而问答题的数据集代表有SQuAD、DuReader和CMRC等。上述问答题数据集中的问题较简单,而高考语文阅读理解的问题较为复杂,背景材料相对较长且答案具有较强的隐藏性。通常考察考生筛选并整合文中关键信息的能力,必须对问题和全文信息进行深度理解和推理才能获取正确答案。高考语文阅读理解中问答题样例如表1所示。

表1 2018年北京高考语文阅读理解问答题
近年来,随着深度学习技术的快速发展和广泛应用,机器阅读理解能力有了大幅提高。深度学习模型的优势在于能够自动捕获文本的有效信息,使得问答系统中很多语义鸿沟问题得到一定程度的改善或解决。端到端的深度学习模型减轻了人工标注的大量工作,灵活多变的深度网络结构提供了强大的文本建模能力。 但是,直接将这些模型应用在高考任务中存在以下不足:
(1) 没有对高考阅读理解问句进行预处理。……
登录APP查看全文
