融合卡方统计和TF-IWF算法的特征提取和短文本分类方法
2021-06-10李昌兵段祺俊纪聪辉张婷婷
重庆理工大学学报(自然科学) 2021年5期
李昌兵,段祺俊,纪聪辉,张婷婷
(重庆邮电大学 a.经济管理学院;b.计算机科学与技术学院,重庆 400065)
随着社交网络以及电子商务的兴起,产生了海量的短文本数据。这些短文本直接反映出人们对不同事件的情感和看法,对短文本信息的挖掘和对短文本的分类成为了热点话题。对短文本的分类研究是自然语言处理的一个重要分支,在搜索引擎、自动问答、舆情分析和情感分析等方面有重要意义[1]。
由于短文本内容短小、口语化严重且噪声大的问题,导致在情感分类的过程中特征极性不显著[2],对短文本内容精准分类的关键是对短文本重要内容的提取。一般通过引入外部语料库和文本自身的内容特征等方式实现。通过外部语料库拓展方法的有效性严重依赖于语料库的质量,计算缓慢、效率低下[3]。而基于短文本自身内容特征的方式是充分挖掘文本语义、词频等关键信息来获取文本的重要特征,对文本特征提取有较高要求。
本文提出了一种融合卡方统计和TF-IWF算法的特征提取和短文本分类方法,旨在解决TFIDF算法计算特征值权重范围小的问题,提升短文本分类的准确率。
1 研究现状
相比较于长文本,短文本的内容稀疏、信息单元难以准确采集,将传统的文本分类方法如支持向量机、朴素贝叶斯分类等直接应用于短文本分类难以取得好的效果[4-5]。针对此问题,研究者提出了一系列对短文本进行特征提取的办法,由此达到提升短文本分类精准率的目的。……
登录APP查看全文
