APP下载

一种基于图注意力网络的短文本分类方法

2021-11-10屈亮亮

关键词:词汇分类文本

屈亮亮,侯 霞

(北京信息科技大学 计算机学院,北京 100101)

0 引言

文本分类是自然语言处理领域内的核心技术之一,它能够完成文档所属标签的预测,广泛用于情感分析、邮件过滤和舆情监测等[1]。传统的文本分类方法依赖人工定义的特征如N-gram(N元模型)、词频—逆文本频率指数(term frequency-inverse document frequency,TF-IDF)和词袋模型(Bag-of-words)等对文本进行表示,然后训练分类器如支持向量机[2]、贝叶斯分类器[3]和K-近邻[4]等进行类别预测。但是,这些表示方法容易产生特征维度过高并且稀疏的问题,而分布式表示通过将文本中的词汇映射至低维且稠密的向量空间,便于利用向量间的距离来衡量词汇间的语义相似度。基于深度学习的文本分类方法已经取得了较为先进的识别效果。其中卷积神经网络[5]和循环神经网络[6]是两类关键的模型,后续方法多基于它们提升分类准确率。卷积神经网络能够关注局部信息,通过多层神经网络可以提取到高层次的特征。循环神经网络能够捕捉词汇间产生的依赖信息,适合处理序列数据。

深度学习相比传统方法缓解了对人工构建特征的依赖,在文本分类任务中实现了不错的识别效果。Kim[5]提出使用不同尺寸的卷积核来提取类似于N-gram的句子特征。Kalchbrenner[7]提出利用k-max pooling(k最大池化)处理不同长度的句子输入,随着层数的增加模型能够考虑句子中相距较远的词汇间的语义依赖。Zhang等[8]提出通过字符级的卷积网络用于文本分类。Lai等[9]使用循环神经网络来捕获上下文信息,然后将前向隐藏状态、词向量和后向隐藏状态连接起来送至最大池化层,以获得文本中最重要的信息。……

登录APP查看全文

猜你喜欢

词汇分类文本
分类算一算
本刊可直接用缩写的常用词汇
一些常用词汇可直接用缩写
在808DA上文本显示的改善
本刊可直接用缩写的常用词汇
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
本刊一些常用词汇可直接用缩写