最近邻注意力和卷积神经网络的文本分类模型
2020-05-09陈世平
小型微型计算机系统 2020年2期
朱 烨,陈世平,2
1(上海理工大学 光电信息与计算机工程学院,上海 200093)2(上海理工大学 信息化办公室,上海 200093)
1 引 言
随着互联网的大规模应用,信息资源不断增加,文本信息成为一种十分重要的信息资源.如何快速、准确、全面的获得有效信息是当前研究的热点问题.近年来,文本分类技术作为自然语言处理和机器学习中的一项基本任务,在情感分析、垃圾邮件识别以及舆情分析中受到了人们的高度重视.
目前文本分类方法主要包括决策树、K近邻(KNN)、支持向量机、朴素贝叶斯、神经网络以及粗糙集等方法[1].但是在传统算法中文本数据存在高维稀疏、特征表达能力较弱、特征项之间易相互影响的缺点,故可能会导致分类时间较长且分类结果较差.
卷积神经网络(Convolutional Neural Network,CNN)是近年来最流行的深度学习算法之一.其显著特点在于:不同卷积核设置不同权重,提取多维特征,通过卷积层和池化层获取文本敏感信息;卷积独特的网络结构使得降维(特征提取)速度更快,结合权值共享使得训练的参数相对较少;网络结构高效简单适应性强[2].
2014年,Kim[3]首先提出卷积神经网络对句子级文本分类,将单词转化为定长词向量,然后采用多尺寸卷积核对词向量卷积,最后进行池化、分类.但该文的不足之处是卷积和池化操作丢失了文本词汇的顺序和位置信息,使语义特征更难捕获.2015年,Lai[4]使用卷积神经网络结合循环神经网络构造网络结构,提出循环卷积神经网络(Recurrent Convolutional Neural Networks,RCNN),将双向……
登录APP查看全文
