密集池化连接和短语注意力下的文本分类算法
2021-07-19黄卫春陶自强熊李艳
科学技术与工程 2021年17期
黄卫春,陶自强*,熊李艳
(1.华东交通大学软件学院,南昌 330013;2.华东交通大学信息学院,南昌 330013)
文本分类任务是自然语言处理中的基础性任务,该问题初期被视作是一些简单的匹配性问题,例如,数据集中存在不同类别的文本,只要事先搜集一些与每个类别相关的词汇,当新样本中有这个词语,就判定它是对应类别即可。但是这种做法显然忽略了句子的整体语义和语境,从而导致文本分类的准确率低等问题。同时,文本分类又是组合了语义信息、语序信息和语境信息的复合型任务,传统的机器学习方法难以对非结构化文本数据进行理解[1-2]。而文本表示方法同样对分类效果有很大影响,李舟军等[3]针对自然语言处理中词语的分布式表示进行了说明。近年来,由于深度学习算法针对非结构化数据处理的优势逐渐明显,开始成为解决文本分类问题的热门选择。
卷积神经网络(convolutional neural network, CNN)在语音识别、自然语言处理和计算机视觉等领域都有很大的应用,并且取得了很好的效果。Kim[4]首次提出将卷积神经网络应用于文本分类处理之中。陶永才等[5]构建了一种基于压缩激发块的卷积神经网络文本分类模型,可以结合文本整体与局部关联性进行语义分析。Wang等[6]提出了一个基于卷积神经网络的框架,该框架结合了两种不同的词语表示方法进行分类。Conneau等[7]提出了一种文本处理体系结构,使用小规模卷积和池化操作,并且证明该模型的性能随卷积深度而增加。……
登录APP查看全文
