基于Attention-based C-GRU神经网络的文本分类
2018-03-13王移芝
计算机与现代化 2018年2期
杨 东,王移芝
(北京交通大学计算机与信息技术学院,北京 100044)
0 引 言
文本分类作为自然语言处理中的经典任务,包括文本预处理、特征提取以及分类器训练等过程。其中最关键的问题是特征提取,传统的方式为词袋法或者空间向量模型,然而这些方式没有考虑文本的语序或上下文信息,且这种浅层表示方法在处理过程中会面临着稀疏性、维度灾难以及丢失大量文本信息等问题。
为了克服浅层表示的缺点,Word Embedding[1]这种词嵌入表示方法被提出,并且取得了良好的表现。同时,深度学习方法不仅在语音识别[2]和机器翻译[3]等领域取得了突出的成绩,在自然语言处理任务中也表现出色。LeCun等人[4]提出了将CNN应用于文本处理,采用卷积层和降采样来提取特征,通过共享权重减少模型参数数量,提高了文本分类的分类效果,CNN是一种典型的空间神经网络。
Mikolov等人[5]提出将基于时间序列的深度神经网络RNN应用于文本分类任务,该模型在隐层中加入了自连接和互连结构,这样当前的节点状态就可以影响下一个节点的状态。RNN在学习长期依赖信息时会面临梯度爆炸或梯度消失等问题,为了避免长期依赖,LSTM和GRU等众多改进结构及变体被提出,其把记住长期消息作为模型的默认行为,而不需付出很大代价去获得。
还有一些人提出了混合模型,例如Lai等人[6]提出了RCNN混合模型,该模型结合了CNN和RNN模型,通过循环网络结构去学习上下文信息,之后采用动态池化层提取文本的关键组成部分,从而提高文本分类的效果。……
登录APP查看全文
