APP下载

局部语义与上下文关系的中文短文本分类算法

2021-03-23黄金杰蔺江全何勇军何瑾洁王雅君

计算机工程与应用 2021年6期
关键词:分类机制文本

黄金杰,蔺江全,何勇军,何瑾洁,王雅君

1.哈尔滨理工大学 自动化学院,哈尔滨 150080

2.哈尔滨理工大学 计算机学院,哈尔滨 150080

近年来,随着互联网的发展及电子社交媒体的深入应用,短文本已成为最常用的信息传递方式之一。与传统的长文本相比,短文本有如下特征[1-2]:(1)文本长度较短;(2)文本的稀疏性强;(3)文本的实时性强;(4)文本的格式不标准;(5)噪声分布不均衡。由此短文本的分类问题成为自然语言处理领域的一个难点问题。传统的机器学习分类算法(如支持向量机算法、朴素贝叶斯算法等)在解决短文本分类问题时,仍存在明显不足[3]。

目前,随着深度学习的快速发展,在文本分类任务中,深度神经网络算法的分类效果一般优于传统的机器学习算法。其中卷积神经网络(Convolutional Neural Networks,CNN)就能很好地解决文本分类问题[4-5]。CNN不仅能获取邻近词汇之间的语义关系,而且能更加精准地提取文本的局部特征[6]。Kim[7]提出了一种卷积神经网络的文本分类模型,该模型在多个公共数据集上均取得了较高的分类准确率。Kalchbrenner 等人[8]提出一种动态卷积神经网络(Dynamic Convolution Neural Network,DCNN)模型,该模型能更好地处理不同长度的文本。

自然语言文本中单词与单词之间存在语义关系,而循环神经网络(Recurrent Neural Network,RNN)模型在隐含层中巧妙地加入自连和互连机制,能够更好地读取上文信息并进行记忆[9-10],因此,RNN模型能更广泛地获得文本的上下文信息,在自然语言处理领域(如文本分类和机器翻译)获得广泛的应用。但RNN模型存在梯度爆炸或梯度消失的问题,为了解决此问题,Hochreiter等人[11]对RNN 模型进行了改进,提出了长短时记忆网络模型(Long Short-Term Memory model,LSTM)。……

登录APP查看全文

猜你喜欢

分类机制文本
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
自制力是一种很好的筛选机制
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
破除旧机制要分步推进
注重机制的相互配合
打基础 抓机制 显成效
如何快速走进文本