APP下载

多特征融合的中文短文本分类模型

2020-07-13杨朝强邵党国杨志豪

小型微型计算机系统 2020年7期
关键词:特征提取分类特征

杨朝强,邵党国,杨志豪,相 艳,马 磊

(昆明理工大学 信息工程与自动化学院,昆明 650504)

1 引 言

随着互联网的高速发展,快速准确地进行文本分类成为研究的热点之一.目前的文本分类算法大多数主要针对长文本,即所处理的文本信息片段较长,包含一定量的信息内容.然而在实际情况中,如何快速准确地实现短文本处理成为文本分类的首要问题之一.短文本指长度不超过160个字符的文本体,以网络文本居多,包括:短新闻、评论、博客、聊天记录等,在信息查询[1],内容推荐[2]和关系抽取[3]等领域具有一定的研究价值.

现阶段而言,短文本分类的研究难点之一在于文本特征提取.文本特征提取方法一般分为三种,传统的文本数据化表示,机器学习和模型融合方法,具体介绍如下:

传统的特征提取为基于空间向量模型(Vecto-r Space Model,VSM)[4],该模型将文本看作不同词的组合形式,未考虑词与词之间的相关性,且该方法存在数据高维稀疏性问题.针对VSM中存在的缺陷,一些研究者通过引入外部先验知识,来对短文本进行语义扩展[5,6],但该方法对引入知识的质量要求较高,同时极大地增加了模型的复杂度.也有学者通过分析文本自身的语义结构[7],来构建文本表示方法,如 LSA,pLSI 和 LDA[8-10],但由于模型构建中只考虑到了文本层面信息,缺乏对低层面信息的分析.

自Google2013年推出具有语义表示功能的Word2vec[11]词向量模型后,神经网络在分类任务中取得了飞速的发展Yoon Kim等人[12]提出的基于CNN(Convolutional Neural Network)的文本分类模……

登录APP查看全文

猜你喜欢

特征提取分类特征
分类算一算
如何表达“特征”
基于Gazebo仿真环境的ORB特征提取与比对的研究
不忠诚的四个特征
教你一招:数的分类
一种基于LBP 特征提取和稀疏表示的肝病识别算法
基于MED和循环域解调的多故障特征提取
线性代数的应用特征
Walsh变换在滚动轴承早期故障特征提取中的应用