基于RoBERTa模型的公众留言分类研究
2021-12-02孟晓龙任正非
孟晓龙,任正非
(1.上海旅游高等专科学校,上海 201418;2.上海师范大学旅游学院,上海 201418;3.科克大学数学学院,科克 爱尔兰)
0 引言
基于大规模文本语料库的预先训练模型能够学习通用语义表征,再根据给定数据集进行微调可以显著提升预先训练模型在各类自然语言处理任务的性能[1]。文本分类作为自然语言处理的一个基础任务,试图推断出给定的文本(或句子、文档等)的标签或标签集合,在如情感倾向分析、新闻主题分类、内容审核、问答系统等[2-3]诸多领域有广泛的应用。
本文基于某政务平台公众留言文本分类数据,分别从如何合理地选择给定数据集的特征来源,如何在效果损失较少的情况下显著地提升模型速率,如何有效地设计微调策略等三个方面进行研究。主要的贡献有:
(1)相对仅选取公众留言数据集的“主题”作为数据特征来源,采用“主题+详情”的效果可提高2%~3%;
(2)相对典型的预先训练模型BERT,本文采用的基于全词掩蔽的扩展模型RoBERTa-wwmext的效果提高2%左右,基于知识蒸馏的压缩模型RBT3的速率提升2~4倍;
(3)相对模型默认微调策略,本文采用的判别微调和倾斜的三角学习率等微调策略效果可提高2%~3%。
1 相关工作
1.1 上下文编码器
Peters等人2018年采用深度双向Bi-LSTM来实现上下文相关,提出[4]一种动态的、语境化的语言模型ELMo(embedding from language models),将目标任务处理转移到预先训练产生词向量的过程中。Devlin等人2018年提出基于多层双向Transformer结构的语义表征模型BERT(bidirectional encoder representations from transformers),同时利用掩码语言模型和下一句子预测任务[5]来获得高级别的语义表征。……
