改进朴素贝叶斯算法在文本分类中的应用
2019-03-13黄勇罗文辉张瑞舒
科技创新与应用 2019年5期
黄勇 罗文辉 张瑞舒
摘 要:朴素贝叶斯算法是一种基于概率统计的分类算法,广泛应用于机器学习中分类问题的求解中。文本分类是自然语言处理和数据挖掘领域中的研究热点有着广泛的应用前景。朴素贝叶斯算法已经在文本分类中取得了较好的分类效果,但是由于文本词向量的特征向量维度高,很多分类算法的求解效率和准确率都不高。文章提出一种基于词向量间余弦相似度的改进朴素贝叶斯算法,有效的降低了特征向量的数据冗余和计算复杂性。
关键词:文本分类;朴素贝叶斯算法;特征向量;余弦相似度
中图分类号:TP391 文献标志码:A 文章编号:2095-2945(2019)05-0024-02
1 概述
在文本分类任务中,目前采用的主要方法是将文本分词,通过词向量技术进行特征提取文本被表示成一个高维度的文本向量集合。然后通过分类器进行文本类别的学习。目前很多主流的机器学习分类算法都取得了较好的分类效果。但是由于文本数据特征表示复杂,分类效率和精度还没有取得较大的提高,朴素贝叶斯算法是在传统贝叶斯算法上假定待分类特征的分量之间相互独立,这使得贝叶斯这种分类方法的工程化应用得以实现[1]。但是文本中的数据由于上下文的语义关系,各个词组的特征向量之间并不都是相互独立的,这给分类器增加了很大的計算和求解负担,参数学习效率低数据特征冗余度大,如果考虑到利用各个上下文词组之间的概率相关性,利用词向量[2]之间的相似度有选择的剔除一些语义近似的词向量将大大简化分类过程。……
登录APP查看全文
