APP下载

基于双向编码表示预训练模型的舆情文本解析分类*

2021-07-26王亚珅李阳阳

科技与创新 2021年13期
关键词:分类特征文本

金 昊,王亚珅,李阳阳

(中国电子科技集团公司电子科学研究院,北京 100041)

1 引言

随着人工智能、大数据及互联网技术的不断发展,舆情监测分析系统也从人工阶段逐渐趋于智能化和自动化。然而,随着网民数量的增加以及网络空间的扩大,所产生的数据也呈爆炸式的增长,Facebook每天处理的数据超过500 TB,阿里巴巴拥有的数据量超过100 PB(1 PB=1 024 TB),新浪微博用户数超过5亿,每天产生的微博数超过1亿条[1]。面对海量舆情数据,急需一种有效的文本分类算法来自动识别和分类舆情信息。

文本解析分类作为自然语言处理(NLP)的基本任务之一,目标是将文本分配到对应的类别中,通常基于已有数据集(文本以及文本对应的类别标签)训练出一个模型,并使其有一定的泛化能力,从而能够对新文本的类别进行预测。文本解析分类可被用于语义分析、问题分类以及话题分类等。最早期的文本分类方法通过设定专家规则、构建专家系统进行分类,但费时费力、覆盖范围和准确率十分有限。后来随着统计学的发展,文本分类问题重视人工特征的提取与浅层分类模型。近期,随着深度学习在图像领域突飞猛进的发展,一些技术,如卷积神经网络(CNN)[2]、递归神经网络(RNN)[3],也逐渐被应用在文本解析分类领域。

基于深度学习进行文本解析分类的方法将文本输入到一个深度网络,首先得到文本特征,然后将文本表示输入到分类器,最后通过softmax得到每个类别的概率。基于卷积神经网络(CNN)的模型可获得具有局部信息的文本特征;……

登录APP查看全文

猜你喜欢

分类特征文本
分类算一算
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
线性代数的应用特征