APP下载

卷积神经网络CNN算法在文本分类上的应用研究

2019-03-13侯小培

科技与创新 2019年4期
关键词:分类深度特征

侯小培,高 迎

(首都经济贸易大学,北京 100070)

随着互联网科学技术的发展,大量的信息涌现出来,用户如何从海量的信息中高效准确地获取有价值信息变得难上加难。文本分类通过利用自然语言处理、数据挖掘和机器学习等技术手段对不同类型的文本数据进行信息分类,目前众多学者主要研究的分类算法包括支持向量机、朴素贝叶斯、决策树以及随机森林等。这些方法在一定程度上提高了文本分类的准确率,但是容易出现局部最优问题,忽略了词语之间、句子之间的关系。深度学习模型卷积神经网络(CNN)是一种深度监督学习下的机器学习模型,与传统机器学习手动提取特征相比,CNN能够自动提取局部特征,权值共享,相比于传统机器学习算法文本分类效果更优。

1 传统机器学习分类方法介绍

文本分类技术是一种高效的信息检索与数据挖掘信息技术。基于机器学习的分类方法通过学习给定的训练集,训练出分类模型,然后使用训练模型来进行文本分类,传统机器学习分类方法有:随机森林(RF)、朴素贝叶斯(NB)、逻辑回归(LR)以及支持向量机(SVM)等。

朴素贝叶斯法是基于贝叶斯定理与特征条件独立假设的分类方法,基于假定:给定目标值时属性之间相互条件独立。其优势在于所需估计的参数很少,对缺失数据不太敏感。

随机森林是利用多棵树对样本训练并预测的分类器,输出类别由个别树输出类别的众数决定。分类过程多次将训练数据集分裂成两个子集完成特征分裂,优点是分类速度快。……

登录APP查看全文

猜你喜欢

分类深度特征
分类算一算
如何表达“特征”
不忠诚的四个特征
深度观察
深度观察
深度观察
教你一招:数的分类
线性代数的应用特征