APP下载

基于关键n-grams 和门控循环神经网络的文本分类模型

2021-03-01刘宗田

上海大学学报(自然科学版) 2021年3期
关键词:单词分类文本

赵 倩,吴 悦,刘宗田

(上海大学计算机工程与科学学院,上海 200444)

传统的文本分类方法将文本表示为词袋模型(bag of words)或基于n-grams的词袋模型(bag of n-grams)[1-2].词袋模型只能捕获文本的局部语义特征,无法获取句子的组合语义信息,而基于n-grams的词袋模型虽然可以捕获词语顺序关系,表达复杂的语义信息,但参数的指数增长使得模型面临计算复杂度过高、特征爆炸等问题.

近年来,研究者采用以词向量为输入的神经网络作为文本处理模型[3-4].循环神经网络(recurrent neural networks,RNN)是一种对序列输入有强大表征能力的模型,但由于梯度消失和梯度爆炸问题[5],无法处理长序列.RNN 的变体门控循环单元(gated recurrent unit,GRU)则可以通过引入门控单元和隐藏状态来避免这些问题[6].另外一种常用的文本分类模型是卷积神经网络(convolutional neural networks,CNN).CNN 首先应用于图像处理,利用一组滤波器提取图像局部特征.当用于文本时,滤波器则用于获取n-grams 的特征.目前,已有研究将CNN 与RNN 的混合模型应用于文本分类.Abreu 等[7]就提出一种基于CNN 和GRU 的文档分类模型,通过注意力机制有效利用文本的单词和句子的上下文语义信息来提高分类性能.Hsu 等[8]则提出一种结构化无关的门控表示对齐(gated representation alignment,GRA)模型,该模型利用对齐机制将CNN 所捕获的短语(n-grams)信息添加到一组GRU 模型中,取得了较好的句子分类效果;通过在GRU 模型中添加不同的方法(注意力机制和对齐机制)来关注重要的n-grams 信息,而本工作提出的模型则着重于优化卷积神经网络模型,降低模型复杂度.

本工作提出了使用……

登录APP查看全文

猜你喜欢

单词分类文本
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
看图填单词
教你一招:数的分类
看完这些单词的翻译,整个人都不好了
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
单词拾趣