APP下载

基于改进的BERT-CNN模型的新闻文本分类研究

2021-09-08张小为邵剑飞

电视技术 2021年7期
关键词:分类文本实验

张小为,邵剑飞

(昆明理工大学 信息工程与自动化学院,云南 昆明 650031)

0 引 言

互联网上的数字文本日益增多,从应用程序到拥有数百万数据的网站,都存在大量计算机难以甄别的文本数据。由于数据量大且文本语义错综复杂,导致文本分类成为一项难题。因此,如何使计算机对大量文本数据进行分类,正成为研究者感兴趣的话题。一般来说,文本分类任务只有很少的类。当分类任务有大量的类时,传统的循环神经网络(Rerrent Neural Network,RNN)[1](如 LSTM 和GRU)算法准确率表现不佳,因此本文引用谷歌大脑发布的基于transformer的来自变换器的双向编码器表征量(Bidirectional Encoder Representations from Transformers,BERT)[2]模型来对中文新闻文本进行分类,数据集采用新浪新闻RSS订阅频道2005年至2011年间的历史数据筛选过滤生成的THUCNews中文文本分类数据集,共有金融、房产、股票、教育、科技、社会、时政、体育、游戏及娱乐10个类别。

1 相关研究

深度神经网络由于其强大的表达能力和较少的实用技术要求,正成为文本分类的常用任务。尽管神经文本识别模型很有吸引力,但在许多应用中,神经文本识别模型缺乏训练数据。近年来,人们提出了多种中文文本分类方法。由于中文文本本身的特点,与英语等其他语言相比,中文文本分类比较困难。为了提高中文文本分类的质量,Liu等人[3]提出了一种分层模型结构,可以从中文文本中按顺序提取上下文和信息,这种方法是LSTM和时间卷积网络的组合。而LSTM用于提取文档的上下文和序列特征。Shao等人[4]提出了一种大规模多标签文本分类的新方法。……

登录APP查看全文

猜你喜欢

分类文本实验
记一次有趣的实验
分类算一算
在808DA上文本显示的改善
做个怪怪长实验
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
NO与NO2相互转化实验的改进
实践十号上的19项实验
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本