多特征融合的中文短文本分类模型
2020-07-13杨朝强邵党国杨志豪
小型微型计算机系统 2020年7期
杨朝强,邵党国,杨志豪,相 艳,马 磊
(昆明理工大学 信息工程与自动化学院,昆明 650504)
1 引 言
随着互联网的高速发展,快速准确地进行文本分类成为研究的热点之一.目前的文本分类算法大多数主要针对长文本,即所处理的文本信息片段较长,包含一定量的信息内容.然而在实际情况中,如何快速准确地实现短文本处理成为文本分类的首要问题之一.短文本指长度不超过160个字符的文本体,以网络文本居多,包括:短新闻、评论、博客、聊天记录等,在信息查询[1],内容推荐[2]和关系抽取[3]等领域具有一定的研究价值.
现阶段而言,短文本分类的研究难点之一在于文本特征提取.文本特征提取方法一般分为三种,传统的文本数据化表示,机器学习和模型融合方法,具体介绍如下:
传统的特征提取为基于空间向量模型(Vecto-r Space Model,VSM)[4],该模型将文本看作不同词的组合形式,未考虑词与词之间的相关性,且该方法存在数据高维稀疏性问题.针对VSM中存在的缺陷,一些研究者通过引入外部先验知识,来对短文本进行语义扩展[5,6],但该方法对引入知识的质量要求较高,同时极大地增加了模型的复杂度.也有学者通过分析文本自身的语义结构[7],来构建文本表示方法,如 LSA,pLSI 和 LDA[8-10],但由于模型构建中只考虑到了文本层面信息,缺乏对低层面信息的分析.
自Google2013年推出具有语义表示功能的Word2vec[11]词向量模型后,神经网络在分类任务中取得了飞速的发展Yoon Kim等人[12]提出的基于CNN(Convolutional Neural Network)的文本分类模……
登录APP查看全文
