卷积神经网络中SPReLU激活函数的优化研究*
2021-09-15吴婷婷许晓东吴云龙
吴婷婷 许晓东 吴云龙
(江苏大学计算机科学与通信工程学院 镇江 212013)
1 引言
随着信息爆炸引发“大数据”时代的到来,海量的文本信息也随之而来,如何从这些浩瀚的文本信息中提取出有价值的文本信息并分类,以及如何提高这些文本信息分类的准确性已成为目前的研究热点和难点。
传统文本分类模型聚焦在特征提取和选择[1]上,常用方法有TF-IDF、词频、互信息等。也有学者认为利用文本的语义信息可以更好地进行文本分类,于是使用语义词典来提取特征并分类[2]。近年来,深度学习(Deep Learning,DL)逐渐发展,深度神经网络(Deep Neural Network)尤其是卷积神经网络(Convolutional Neural Networks,CNN)[3~4]作为近几年来图像处理和语音识别中的研究热点[5],在自然语言处理(Natural Language Processing,NLP)的各个任务中也都取得了显著效果[6]。因此,学者们的研究重心转移到了基于深度神经网络的分类模型上[7]。
深度神经网络文本分类模型[8~9]的性能优越,CNN模型的研究工作受到了学者的高度重视。随着研究的不断深入,学者们发现CNN模型中存在一些问题,例如,CNN模型本身比较复杂,建模过程存在一定难度;由于某些激活函数具有特殊的性质,导致了CNN模型在训练过程中容易出现梯度消失[10]、神经元死亡[11]、均值偏移[12]、收敛速度慢、稀疏表达能力弱等问题[13]。
为了解决上述问题,本文分析研究了几种常用激活函数的特性,并综合ReLU、PReLU、Softplus三种激活函数的优缺点,提出了一种新型激活函数SPReLU。最后,建立基于CNN的文本分类模型,在MR数据集上进行实验,对比这几种激活函数对文本分类模型的准确率和损失函数的影响。……
