APP下载

基于条件变分自编码网络的短文本分类

2021-09-16郑山红李万龙

计算机应用与软件 2021年9期
关键词:分类特征文本

康 宸 郑山红 李万龙

(长春工业大学 吉林 长春 130012)

0 引 言

文本分类是基于文本中的词项等一些内置属性,能够成功地将每个文档分类到预先定义好的类别中。在自然语言处理文本挖掘领域,文本分类是一项重要的研究内容,被广泛应用于Web搜索、日志分析、信息过滤和情感分析等领域[1]。随着互联网大数据的发展,短文本数据的规模迅速增长,对短文本进行高效准确的分类显得非常重要。与长文本分类不同,由于文本主题特征稀疏,短文本中有利于文本分类的主题特征不够充分,因此导致传统的文本分类模型处理短文本的分类效果不佳。

文本分类的相关工作可以追溯到20世纪50年代。文本分类包含以下六个主要步骤:准备训练和测试数据、文本规范化处理、特征抽取、模型训练、模型预测与评估、应用部署,其中特征抽取以及模型训练尤为重要。传统的特征抽取方法有通过计算特征权重选定阈值过滤特征的统计方式,如互信息(MI)[2]、χ2统计量(CHI)[2]和期望交叉熵[2]等。由于这些方法都是基于统计的方式进行特征抽取,不仅需要繁琐的特征工程,而且对于字符数比较少的短文本特征抽取不够充分,最终的分类效果往往很差。随着统计机器学习的发展,特征抽取可以不依靠繁琐的特征工程,而是由模型自己训练得到,但是需要额外的表示文本。常见的文本表示包括词袋模型和向量空间模型(VSM),这些文本表示方式在长文本分类中有很好的效果,但是对于短文本,这些文本表示导致维度高且系数,模型训练过程参数众多且有效特征稀疏,训练模型很容易发生过拟合,如基于SVM的统计机器学习文本分类算法[3-4]。……

登录APP查看全文

猜你喜欢

分类特征文本
分类算一算
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
线性代数的应用特征