APP下载

基于朴素贝叶斯的短文本分类研究

2018-10-21檀亚宁刘宏玉王子浪

科学导报·学术 2018年40期
关键词:分类文本

檀亚宁 刘宏玉 王子浪

摘要:自然语言处理是目前智能科学领域中的一个非常热门的方向,文本的分类同样也是自然语言处理中的一项关键的技术。随着深度学习发展,朴素贝叶斯算法也已经在文本的分类中取得到了良好的分类效果。本文针对短文本的分类问题,首先对短文本数据进行了预处理操作,其中包括中文分词、去除停用词以及特征的提取,随后阐明了朴素贝叶斯算法构建分类器的过程,最后将朴素贝叶斯算法与逻辑回归和支持向量机分类算法的分类效果进行了对比分析,得出朴素贝叶斯算法在训练所需的效率上及准确率上有较为优异的表现。

关键词:自然语言处理文本分类机器学习朴素贝叶斯

引言

文本分类问题是自然语言处理中的一个非常经典的问题。文本分类是计算机通过按照一定的分类标准进行自动分类标记的有监督学习过程。在文本特征工程中,和两种方法应用最为广泛[1] 。在分類器中,使用普遍的有朴素贝叶斯,逻辑回归,支持向量机等算法。其中朴素贝叶斯是基于贝叶斯定理与特征条件独立假设的分类方法,有着坚实的数学基础,以及稳定的分类效率。基于此,本文采用基于的特征提取的朴素贝叶斯算法进行文本分类,探求朴素贝叶斯算法在短文本分类中的适用性。

1数据预处理

1.1中文分词

中文分词是指将一个汉字序列切分成一个个单独的词。中文分词是中文文本处理的一个基础步骤,也是对中文处理较为重要的部分,更是人机自然语言交流交互的基础模块。……

登录APP查看全文

猜你喜欢

分类文本
分类算一算
垃圾分类的困惑你有吗
初中群文阅读的文本选择及组织
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化
给塑料分分类吧
如何快速走进文本