基于BERT模型的航天科技开源情报分类
2021-04-09孔凡芃刘旭红刘秀磊
孔凡芃,刘旭红,刘秀磊,李 晗
(1.北京信息科技大学 网络文化与数字传播北京市重点实验室,北京 100192;2.北京信息科技大学 数据与科学情报分析实验室,北京 100192;3.北京大学 北大方正集团有限公司数字出版技术国家重点实验室,北京 100101)
0 引言
近年来航天事业迅猛发展,开源情报[1]的价值与日俱增,互联网上航天科技开源情报的爆炸式增长为情报的快速分类带来严峻挑战,提升相关情报的分类准确率对于提高航天领域科研人员的工作效率具有重大意义。
航天科技开源情报的分类本质上属于文本分类问题。目前文本分类技术已经较为成熟,常见的主流方法有以卷积神经网络(CNN)[2]与循环神经网络(RNN)[3]为基础的深度学习模型,如文献[2]中提出的TextCNN模型,利用多个不同大小的卷积核提取句子中的关键信息,从而能够更好地捕捉局部相关性。文献[4]提出的R-CNN算法,首次将深度学习应用于目标检测中,将目标检测的验证指标mAP提升了30%,并大大减少了计算量。但上述模型在训练过程需要大量语料,且耗费较多时间与硬件资源。后续出现了基于迁移学习的模型,如Word2Vec[5]、GloVe[6]、FastText[7]等。上述模型可以对少量语料进行预训练,生成词向量后用于下游NLP任务,缓解了由于部分领域语料过少而导致训练效果较差的问题。Transformer[8]等语言模型架构的提出,及相关方法如GPT[9]、BERT[10]、ULMFiT[11]的使用,使得迁移学习在下游NLP任务如文本分类中取得突破性进展。
在航天领域文本分类研究中,张亚超[12]提出基于注意力机制的TextRCNN-A文本分类算法,不仅可以捕捉上下文内容信息,还可以更好地消除单词歧义。……
