基于多通道循环卷积神经网络的文本分类方法
2020-09-02陆超红
计算机应用与软件 2020年8期
陆 超 红
(中国科学技术大学计算机科学与技术学院中国科大-伯明翰大学智能计算与应用联合研究所 安徽 合肥 230027)
0 引 言
文本分类是自然语言处理的核心任务之一,在垃圾邮件检测[2]、主题分类[3]和情感分析[4]等领域有着大量的应用[1]。传统的文本分类方法包括:朴素贝叶斯[5]、支持向量机、K近邻以及决策树等。这些分类方法大多使用稀疏的词汇特征来表示文本,常见的文本表示方法有词袋模型(Bag of Words,BoW)以及向量空间模型(Vector Space Model,VSM)等。这些文本表示方法通常忽略了文本上下文关系,并且丢失了语序信息,因此不能很好地提取文本的语义特征。
随着深度学习的发展,词的分布式表示凸显出了极大的优势。Bengio等[6]提出了神经概率语言模型(Neural Probabilistic Language Model,NPLM),词向量嵌入可以通过训练该模型来得到。Mikolov等[7]提出了用连续词袋模型(CBoW)和连续跳跃元语法模型[7](Skip-Gram)来训练词向量。
连续词袋模型通过周围的词来预测中心词,连续跳跃元语法模型则是通过中心词来预测周围词,这些模型由于考虑到了上下文信息,因此有语义表征能力。预训练的词向量与传统的文本表示方法相比,具有低维、稠密等特点,而且会让语义相似词的词向量在欧氏空间中的距离较小,因此在深度学习中得到了大规模的应用。
基于预训练的词向量表示,研究者提出利用循环神经网络(Recurrent Neural Network, RNN)[8]来对序列进行建模。这种模型会将文本的所有历史信息保存在一个定长隐状态向量中,因此能够捕捉文本中的长期依赖。然……
登录APP查看全文
