知识感知的预训练语言模型综述
2021-09-15李瑜泽柯尊旺吾守尔斯拉木
计算机工程 2021年9期
李瑜泽,栾 馨,柯尊旺,李 哲,吾守尔·斯拉木
(1.新疆大学 信息科学与工程学院,乌鲁木齐 830046;2.新疆多语种信息技术实验室,乌鲁木齐 830046;3.新疆多语种信息技术研究中心,乌鲁木齐 830046;4.新疆大学 软件学院,乌鲁木齐 830046)
0 概述
自然语言处理(Natural Language Processing,NLP)是人工智能和语言学领域的分支学科,近年来,NLP 的发展取得了巨大进步,任务划分也更加详尽,其主要下游任务,如关系抽取[1]、文本分类[2]、对话生成、机器翻译和共指消解[3]等均离不开预训练技术。预训练技术使用大规模无标注的文本语料库对深层网络结构进行训练,从而得到一组模型参数,这种深层网络结构通常被称为“预训练模型”[4]。将训练得到的模型参数运用于后续特定的下游任务,可避免从零开始进行再训练的繁琐过程。预训练模型的优点在于训练代价较小,配合下游任务能够达到更好的收敛效果,可以较好地提升模型的性能。
自BERT[5]模型被提出以来,各种预训练语言模型层出不穷。然而,非知识感知的预训练语言模型通常采用浅层网络结构,只进行简单的学习,无法理解更高层次的文本概念,如语义角色、指代等;而知识感知的预训练语言模型能够根据不同的应用目的而加强不同的模块,使模型具备更加专业的业务能力。因此,面对智能要求和专业化程度更高的深层次NLP 任务,需要探索并分析将特定种类的外部知识嵌入到特定用途的预训练语言模型中。
目前,已有部分研究人员尝试将外部知识嵌入到预训练语言模型中,评估其在特定下游任务中的性能表现。……
登录APP查看全文
