基于BERT和深层等长卷积的新闻标签分类
2021-08-20杨文浩刘广聪罗可劲
计算机与现代化 2021年8期
杨文浩,刘广聪,罗可劲
(广东工业大学计算机学院,广东 广州 511400)
0 引 言
随着互联网技术在21世纪的高速发展,文本数据从传统的实体化向数字化、虚拟化转变。微博、新浪等新闻媒体每时每刻都产生着来自不同领域的新闻文本数据,这些文本往往蕴含大量的信息。怎样对这些文本进行数据挖掘成为学术界研究的重点问题,其中如何准确、高效地对这些文本进行标签分类成为学者们研究的热点。
1 相关工作
文本分类方法主要有3种:基于规则的方法、基于机器学习的方法和基于深度神经网络的方法[1]。基于规则的方法主要是依靠专家定制的一系列规则来对文本进行分类,但规则的构建往往需要大量的语言学知识且费时费力,分类的准确率也有很大的波动。后来随着统计学习方法的发展,学者们逐渐把机器学习方法运用到文本分类任务上。这种方法要把文本转化成计算机能够理解的格式,并携带着足够的原生文本信息,最后交给K-邻近、支持向量机等分类器来完成标签分类[2]。如何将文本在转换成计算机能够理解的格式的同时又最大化地保留文本的原生信息就成了研究的热点,学者将其称为特征工程。词袋模型[3]用于文本表示时存在的维度灾难和特征稀疏等问题,特征工程往往困难重重且需要经验丰富的专家进行,成本很高。
随着计算机计算能力的提升,学者们将深度神经网络运用在图像处理和语音识别领域中并取得了惊人的成果,很多学者也开始把深度神经网络运用到自然语言处理领域[4-5]。……
登录APP查看全文
